文件導航

Kev-0.6B (Qwen3)

上一代(Qwen3)。 作為 Apple Silicon 上快速的小選項保留(每個五問題請求 0.12 s,而 Kev-0.8B 為 0.33 s)。要準確率請用 Kev-0.8B:在鎖定測試上,同一批條目它域外得 0.668,而本模型得 0.642。權重:jaredpalmer/kev-0.6b。

Kev-0.6B 是一個決策模型:一份文件(狀態)和一組帶型別的問題進去,每個問題一個機率分佈出來,全在一次前向傳播裡完成。不生成文本。它是 Qwen/Qwen3-0.6B-Base 上的 LoRA 介面卡(r=16)加一個指標頭,服務 TypeSafe 公開的 /v1/systemone 契約。

Kev 家族裡的小成員。 它是在一套凍結、帶校驗和的評測協議下最好的 0.6B checkpoint:用 4B/8B 配方的資料(decision-v7)在 lr 1e-4 下、三個 seed(transfer 0.613 / 0.605 / 0.620),此前八次單旋鈕變體和三個 seed 的上一版資料都沒找到比 0.61 更好的。域外它就是個 0.6B 模型 —— 要準確率請用 Kev-4B;當記憶體或延遲排除了 4B 時用它,並在你自己的資料上測量。

  • Hub:jaredpalmer/kev-0.6b(本倉庫;試驗 v7-06b/02-trial-2,3 個 seed 中的 seed 2)
  • 程式碼、套件、結果和完整研究日誌:github.com/jaredpalmer/kev —— 見 PLAN.md(完整記錄在 git tag research-archive-2026-09-24)、runs/leaderboard.md 和 evals/v4/*/manifest.json

自 Kev-0.5B 以來的變化

Kev-0.5B Kev-0.6B(本模型)
主幹 Qwen2.5-0.5B Qwen3-0.6B-Base
訓練記錄 9,000(六個來源) 12,576(十個公開來源 + 896 條策略最小對 + 1,680 條來自 60 個隨機規則結構的記錄)
none-of-the-above 僅增強修復 + 最小對:同一個 state 渲染兩種版本,真選項在場與移除
分佈內準確率(decision-v4 dev) 0.712 0.801
域外準確率(transfer-v4 dev) 0.561 0.620
none 選項在場時的準確率 0.25(transfer-v1) 0.80
數字背後的 seed 數 1 3(transfer 0.605–0.620)

Jev(typesafe-ai/jev,經 Vercel AI Gateway)在同一批凍結開發集上:分佈內 0.845,域外 0.857。本 checkpoint 的逐來源遷移準確率:QNLI 0.85、SciQ 0.93、TweetEval-offensive 0.69、PAWS 0.59、Emotion 0.49、MMLU 0.50;留出策略結構接近隨機。

已知侷限

  • 域外它就是個 0.6B 模型。 在我們試過的每個超參數下遷移準確率都平在約 0.60(八次單旋鈕變體、三個 seed)。同一配方在 4B 達到 0.72–0.75,在 8B 達到 0.74–0.77;在這個規模上瓶頸是容量,不是資料。
  • 留出策略推理失敗:在規則結構從未訓練過的程式化策略對上,兩兄弟都答對的比例是 6–11%(Kev-4B 0.73,Jev 0.86)。
  • 序數對沖:在帶日期算術的 3 檔 Score 問題上,它會塌到中間檔。
  • 域外自信錯誤率為 11%(置信度 ≥0.9 且答錯);分佈內原始 ECE 0.09,域外 0.15。機率在分佈內可用;在其他地方當作參考。
  • 鎖定測試,只讀一次(runs/locked/kev-06b-v7-ungated/):分佈內準確率 0.808(Brier 0.266,ECE 0.089),域外 0.642(Brier 0.483,ECE 0.128,自信錯誤 7.9%)。這個劃分不會再為本 checkpoint 讀取。

架構

只做 prefill 的因果 LM,帶塊因果注意力掩碼:一個共享的 state 字首,每個問題一條隔離分支,並在選項邊界 token 上做指標讀出。打包進一個請求的問題得到的機率與單獨詢問完全一致(實測最大差 4e-6)。細節見倉庫 README。

訓練

凍結套件 evals/v7/decision-v7(manifest 釘住資料集與基座模型 revision):10,000 條公開記錄(每來源 1,000),896 條覆蓋九個模板家族的策略最小對記錄,以及 1,680 條來自 60 個隨機生成規則結構的記錄,兩個 epoch,LoRA r=16 作用於注意力與 MLP 投影,lr 1e-4,指標頭從頭訓練,在選項分佈上做交叉熵,bf16 autocast 配 fp32 主權重,在一張 H100 上約 12 分鐘。增強:選項置換、none-of-the-above 插入、干擾項,以及對 25% 的 Choice 記錄做 none 最小對。訓練沒有使用任何 Jev 輸出。

評測協議

開發劃分用於選模型;存在一個鎖定的測試劃分,每個晉升候選最多讀一次。上面每個數字都在 result.json 裡帶著套件 hash、程式碼 hash 和 git commit。比較使用按記錄聚類的配對 bootstrap。我們對自己更早主張的更正見 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。

使用

from typesafe import TypeSafeClient   # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")

在倉庫裡用 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008 服務。

許可證

介面卡與指標頭為 Apache-2.0。基座模型為 Apache-2.0(Qwen3)。訓練資料集各有自己的許可證。