Kev-0.6B (Qwen3)
上一代(Qwen3)。 作為 Apple Silicon 上快速的小選項保留(每個五問題請求 0.12 s,而 Kev-0.8B 為 0.33 s)。要準確率請用 Kev-0.8B:在鎖定測試上,同一批條目它域外得 0.668,而本模型得 0.642。權重:
jaredpalmer/kev-0.6b。
Kev-0.6B 是一個決策模型:一份文件(狀態)和一組帶型別的問題進去,每個問題一個機率分佈出來,全在一次前向傳播裡完成。不生成文本。它是 Qwen/Qwen3-0.6B-Base 上的 LoRA 介面卡(r=16)加一個指標頭,服務 TypeSafe 公開的 /v1/systemone 契約。
Kev 家族裡的小成員。 它是在一套凍結、帶校驗和的評測協議下最好的 0.6B checkpoint:用 4B/8B 配方的資料(decision-v7)在 lr 1e-4 下、三個 seed(transfer 0.613 / 0.605 / 0.620),此前八次單旋鈕變體和三個 seed 的上一版資料都沒找到比 0.61 更好的。域外它就是個 0.6B 模型 —— 要準確率請用 Kev-4B;當記憶體或延遲排除了 4B 時用它,並在你自己的資料上測量。
- Hub:
jaredpalmer/kev-0.6b(本倉庫;試驗v7-06b/02-trial-2,3 個 seed 中的 seed 2) - 程式碼、套件、結果和完整研究日誌:github.com/jaredpalmer/kev —— 見
PLAN.md(完整記錄在 git tagresearch-archive-2026-09-24)、runs/leaderboard.md和evals/v4/*/manifest.json
自 Kev-0.5B 以來的變化
| Kev-0.5B | Kev-0.6B(本模型) | |
|---|---|---|
| 主幹 | Qwen2.5-0.5B | Qwen3-0.6B-Base |
| 訓練記錄 | 9,000(六個來源) | 12,576(十個公開來源 + 896 條策略最小對 + 1,680 條來自 60 個隨機規則結構的記錄) |
| none-of-the-above | 僅增強修復 | + 最小對:同一個 state 渲染兩種版本,真選項在場與移除 |
| 分佈內準確率(decision-v4 dev) | 0.712 | 0.801 |
| 域外準確率(transfer-v4 dev) | 0.561 | 0.620 |
| none 選項在場時的準確率 | 0.25(transfer-v1) | 0.80 |
| 數字背後的 seed 數 | 1 | 3(transfer 0.605–0.620) |
Jev(typesafe-ai/jev,經 Vercel AI Gateway)在同一批凍結開發集上:分佈內 0.845,域外 0.857。本 checkpoint 的逐來源遷移準確率:QNLI 0.85、SciQ 0.93、TweetEval-offensive 0.69、PAWS 0.59、Emotion 0.49、MMLU 0.50;留出策略結構接近隨機。
已知侷限
- 域外它就是個 0.6B 模型。 在我們試過的每個超參數下遷移準確率都平在約 0.60(八次單旋鈕變體、三個 seed)。同一配方在 4B 達到 0.72–0.75,在 8B 達到 0.74–0.77;在這個規模上瓶頸是容量,不是資料。
- 留出策略推理失敗:在規則結構從未訓練過的程式化策略對上,兩兄弟都答對的比例是 6–11%(Kev-4B 0.73,Jev 0.86)。
- 序數對沖:在帶日期算術的 3 檔 Score 問題上,它會塌到中間檔。
- 域外自信錯誤率為 11%(置信度 ≥0.9 且答錯);分佈內原始 ECE 0.09,域外 0.15。機率在分佈內可用;在其他地方當作參考。
- 鎖定測試,只讀一次(
runs/locked/kev-06b-v7-ungated/):分佈內準確率 0.808(Brier 0.266,ECE 0.089),域外 0.642(Brier 0.483,ECE 0.128,自信錯誤 7.9%)。這個劃分不會再為本 checkpoint 讀取。
架構
只做 prefill 的因果 LM,帶塊因果注意力掩碼:一個共享的 state 字首,每個問題一條隔離分支,並在選項邊界 token 上做指標讀出。打包進一個請求的問題得到的機率與單獨詢問完全一致(實測最大差 4e-6)。細節見倉庫 README。
訓練
凍結套件 evals/v7/decision-v7(manifest 釘住資料集與基座模型 revision):10,000 條公開記錄(每來源 1,000),896 條覆蓋九個模板家族的策略最小對記錄,以及 1,680 條來自 60 個隨機生成規則結構的記錄,兩個 epoch,LoRA r=16 作用於注意力與 MLP 投影,lr 1e-4,指標頭從頭訓練,在選項分佈上做交叉熵,bf16 autocast 配 fp32 主權重,在一張 H100 上約 12 分鐘。增強:選項置換、none-of-the-above 插入、干擾項,以及對 25% 的 Choice 記錄做 none 最小對。訓練沒有使用任何 Jev 輸出。
評測協議
開發劃分用於選模型;存在一個鎖定的測試劃分,每個晉升候選最多讀一次。上面每個數字都在 result.json 裡帶著套件 hash、程式碼 hash 和 git commit。比較使用按記錄聚類的配對 bootstrap。我們對自己更早主張的更正見 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。
使用
from typesafe import TypeSafeClient # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
在倉庫裡用 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008 服務。
許可證
介面卡與指標頭為 Apache-2.0。基座模型為 Apache-2.0(Qwen3)。訓練資料集各有自己的許可證。