Kev-8B (Qwen3)
上一代(Qwen3)。 這個 checkpoint 作為 Apple Silicon 上的快速選項保留(它只含注意力的主幹在 MPS 上全速跑打包前向)。要準確率與校準請用 Kev-9B:在鎖定測試上,同一批條目它域外得 0.837,而本模型得 0.780。權重:
jaredpalmer/kev-8b。
Kev-8B 是一個決策模型:一份文件(狀態)和一組帶型別的問題進去,每個問題一個機率分佈出來,全在一次前向傳播裡完成。不生成文本。它是 Qwen/Qwen3-8B-Base(revision 49e3418f)上的 LoRA 介面卡(r=16)加一個指標頭,服務 TypeSafe 公開的 /v1/systemone 契約。
最準確的 Kev。 它是在一套凍結、帶校驗和的協議下任何規模裡最好的 checkpoint:分佈內準確率最好、域外準確率最好(transfer-v4 dev 上 0.796,距 Jev 六個點)、8B 裡任何 Kev 中留出規則推理最好。同一配方在兩個 seed 上:0.796 / 0.774;本 checkpoint 是在開發劃分上選出的那個 seed。
- Hub:
jaredpalmer/kev-8b(本倉庫;試驗v7-final/00-trial-0) - 程式碼、套件、每次試驗的 hash 與配對 bootstrap:github.com/jaredpalmer/kev ——
PLAN.md(完整記錄在 git tagresearch-archive-2026-09-24)、runs/leaderboard.md
結果(每一行都是同一批凍結條目)
| Kev-0.5B(原型) | Kev-0.6B | Kev-4B | Kev-8B | Jev | |
|---|---|---|---|---|---|
| 分佈內準確率(decision-v4 dev,1,200 q) | 0.712 | 0.801 | 0.854 | 0.863 | 0.845 |
| 域外準確率(transfer-v4 dev,560 q) | 0.561 | 0.620 | 0.790 | 0.796 | 0.857 |
| 域外 Brier | 0.50 | 0.536 | 0.328 | 0.337 | 0.211 |
| 域外自信錯誤(p ≥ 0.9 且答錯) | – | 10.8% | 8.2% | 9.9% | 3.7% |
| 留出策略結構,兩兄弟都答對 | – | 0.08 | 0.73 | 0.69 | 0.86 |
| 選項順序翻轉率 | 0.21 | 0.02 | 0.00 | 0.00 | 0.00 |
逐來源域外準確率(Kev-8B / Jev):QNLI 0.91 / 0.93、SciQ 1.00 / 0.99、TweetEval-offensive 0.79 / 0.81、PAWS 0.78 / 0.79、MMLU 0.70 / 0.90、Emotion 0.56 / 0.59、deadline(3 檔日期算術)0.60 / 0.93、(A and B) or not C 0.91 / 0.97、if A then not B else C 0.59 / 0.78。
Seed:decision-v7 上兩個 seed:transfer 0.796 / 0.774,留出規則對 0.69 / 0.64(Jev 0.86);本 checkpoint 是 seed 0。在 decision-v7 上訓練(10k 公開記錄 + 896 條策略記錄,覆蓋九個模板家族,含四個序數 Score 閾值家族 + 1,680 條來自 60 個隨機規則結構的記錄,取反可在任意位置);開發/測試條目與 v4 逐位元組相同,所以這裡每個數字都可與更早的 checkpoint 比較。
鎖定測試,只讀一次(runs/locked/kev-8b-v7-preview-ungated/):分佈內 0.870(Brier 0.193),域外 0.780(Brier 0.327,自信錯誤 7.6%,留出對 0.62)。這個劃分不會再為本 checkpoint 讀取。
訓練它時我們學到什麼
- 域外由容量主導。 在公開樣本與合成預算相同的情況下,0.6B → 4B 是 +14–19 pp;4B → 8B 是 +1–7 pp。
- 微調會侵蝕基座能力,而學習率控制著侵蝕程度。 4B 基座用字母讀出做 zero-shot,在同一批 MMLU 條目上得 0.688、在 PAWS 上得 0.787;預設配方(lr 2e-4)訓練後降到 0.60–0.66 / 0.56–0.71。把 lr 降到 5e-5 能恢復大部分,這是我們找到的最大單項配方改進;更少的 LoRA 目標模組和更小的 rank 幫助更小。
- 更多公開訓練資料會提高分佈內準確率、降低遷移(在 4B 上,10k 對 3.4k 條記錄:−3 pp)。知識 MCQ 來源(ARC、OpenBookQA、CommonsenseQA)把分佈內準確率提到 0.86,但不移動遷移。
- 程式化對比策略對能教會已訓練的規則結構(兩兄弟正確 0.85–1.0),但對未見結構的遷移只是部分有效(4B 上 0.5–0.6,0.6B 上 0.03–0.11)。
已知侷限
- 留出策略推理(未見的規則組合、頻寬限期的日期算術)距 Jev 很遠。
- 沒有訓練類似物的產品形狀問題沒有保證;在你自己的輸入上測量。
- 域外機率可用但未校準(原始 ECE 0.128);在分佈內擬合的溫度不遷移。
- 8B fp32 需要約 33 GB,裝不進 32 GB Mac;
KEV_DTYPE=bf16(約 17 GB)可以。訓練在一張 H100 上約 70 分鐘。
訓練
凍結套件 evals/v6/decision-v6(開發/測試位元組與 v4 相同):13,000 條公開記錄(每個來源 1,000:十個 v4 來源加 ARC-Challenge、OpenBookQA、CommonsenseQA)加兩個程式化策略臂共 448 條記錄,兩個 epoch,LoRA r=16 作用於注意力與 MLP 投影,指標頭從頭訓練,在選項分佈上做交叉熵,lr 5e-5(OneCycle),有效 batch 8,bf16 autocast 配 fp32 主權重,梯度 checkpointing,一張 H100(約 70 分鐘)。增強:選項置換、none-of-the-above 插入、干擾項,以及對 25% 的 Choice 記錄做 none 最小對。訓練沒有使用任何 Jev 輸出。
評測協議
開發劃分用於選模型;鎖定的測試劃分每個候選最多讀一次。每個數字都在 result.json 裡帶著套件 hash、程式碼 hash 和 git commit。我們對自己更早主張的更正見 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。
使用
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-8b --port 8008 # KEV_DTYPE=bf16 on a 32 GB Mac
任何 TypeSafe 相容客戶端都可用:TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。
許可證
介面卡與指標頭為 Apache-2.0;Qwen3 基座為 Apache-2.0;資料集各有自己的許可證。