文件導航

Kev-8B (Qwen3)

上一代(Qwen3)。 這個 checkpoint 作為 Apple Silicon 上的快速選項保留(它只含注意力的主幹在 MPS 上全速跑打包前向)。要準確率與校準請用 Kev-9B:在鎖定測試上,同一批條目它域外得 0.837,而本模型得 0.780。權重:jaredpalmer/kev-8b。

Kev-8B 是一個決策模型:一份文件(狀態)和一組帶型別的問題進去,每個問題一個機率分佈出來,全在一次前向傳播裡完成。不生成文本。它是 Qwen/Qwen3-8B-Base(revision 49e3418f)上的 LoRA 介面卡(r=16)加一個指標頭,服務 TypeSafe 公開的 /v1/systemone 契約。

最準確的 Kev。 它是在一套凍結、帶校驗和的協議下任何規模裡最好的 checkpoint:分佈內準確率最好、域外準確率最好(transfer-v4 dev 上 0.796,距 Jev 六個點)、8B 裡任何 Kev 中留出規則推理最好。同一配方在兩個 seed 上:0.796 / 0.774;本 checkpoint 是在開發劃分上選出的那個 seed。

  • Hub:jaredpalmer/kev-8b(本倉庫;試驗 v7-final/00-trial-0)
  • 程式碼、套件、每次試驗的 hash 與配對 bootstrap:github.com/jaredpalmer/kev —— PLAN.md(完整記錄在 git tag research-archive-2026-09-24)、runs/leaderboard.md

結果(每一行都是同一批凍結條目)

Kev-0.5B(原型) Kev-0.6B Kev-4B Kev-8B Jev
分佈內準確率(decision-v4 dev,1,200 q) 0.712 0.801 0.854 0.863 0.845
域外準確率(transfer-v4 dev,560 q) 0.561 0.620 0.790 0.796 0.857
域外 Brier 0.50 0.536 0.328 0.337 0.211
域外自信錯誤(p ≥ 0.9 且答錯) – 10.8% 8.2% 9.9% 3.7%
留出策略結構,兩兄弟都答對 – 0.08 0.73 0.69 0.86
選項順序翻轉率 0.21 0.02 0.00 0.00 0.00

逐來源域外準確率(Kev-8B / Jev):QNLI 0.91 / 0.93、SciQ 1.00 / 0.99、TweetEval-offensive 0.79 / 0.81、PAWS 0.78 / 0.79、MMLU 0.70 / 0.90、Emotion 0.56 / 0.59、deadline(3 檔日期算術)0.60 / 0.93、(A and B) or not C 0.91 / 0.97、if A then not B else C 0.59 / 0.78。

Seed:decision-v7 上兩個 seed:transfer 0.796 / 0.774,留出規則對 0.69 / 0.64(Jev 0.86);本 checkpoint 是 seed 0。在 decision-v7 上訓練(10k 公開記錄 + 896 條策略記錄,覆蓋九個模板家族,含四個序數 Score 閾值家族 + 1,680 條來自 60 個隨機規則結構的記錄,取反可在任意位置);開發/測試條目與 v4 逐位元組相同,所以這裡每個數字都可與更早的 checkpoint 比較。

鎖定測試,只讀一次(runs/locked/kev-8b-v7-preview-ungated/):分佈內 0.870(Brier 0.193),域外 0.780(Brier 0.327,自信錯誤 7.6%,留出對 0.62)。這個劃分不會再為本 checkpoint 讀取。

訓練它時我們學到什麼

  • 域外由容量主導。 在公開樣本與合成預算相同的情況下,0.6B → 4B 是 +14–19 pp;4B → 8B 是 +1–7 pp。
  • 微調會侵蝕基座能力,而學習率控制著侵蝕程度。 4B 基座用字母讀出做 zero-shot,在同一批 MMLU 條目上得 0.688、在 PAWS 上得 0.787;預設配方(lr 2e-4)訓練後降到 0.60–0.66 / 0.56–0.71。把 lr 降到 5e-5 能恢復大部分,這是我們找到的最大單項配方改進;更少的 LoRA 目標模組和更小的 rank 幫助更小。
  • 更多公開訓練資料會提高分佈內準確率、降低遷移(在 4B 上,10k 對 3.4k 條記錄:−3 pp)。知識 MCQ 來源(ARC、OpenBookQA、CommonsenseQA)把分佈內準確率提到 0.86,但不移動遷移。
  • 程式化對比策略對能教會已訓練的規則結構(兩兄弟正確 0.85–1.0),但對未見結構的遷移只是部分有效(4B 上 0.5–0.6,0.6B 上 0.03–0.11)。

已知侷限

  • 留出策略推理(未見的規則組合、頻寬限期的日期算術)距 Jev 很遠。
  • 沒有訓練類似物的產品形狀問題沒有保證;在你自己的輸入上測量。
  • 域外機率可用但未校準(原始 ECE 0.128);在分佈內擬合的溫度不遷移。
  • 8B fp32 需要約 33 GB,裝不進 32 GB Mac;KEV_DTYPE=bf16(約 17 GB)可以。訓練在一張 H100 上約 70 分鐘。

訓練

凍結套件 evals/v6/decision-v6(開發/測試位元組與 v4 相同):13,000 條公開記錄(每個來源 1,000:十個 v4 來源加 ARC-Challenge、OpenBookQA、CommonsenseQA)加兩個程式化策略臂共 448 條記錄,兩個 epoch,LoRA r=16 作用於注意力與 MLP 投影,指標頭從頭訓練,在選項分佈上做交叉熵,lr 5e-5(OneCycle),有效 batch 8,bf16 autocast 配 fp32 主權重,梯度 checkpointing,一張 H100(約 70 分鐘)。增強:選項置換、none-of-the-above 插入、干擾項,以及對 25% 的 Choice 記錄做 none 最小對。訓練沒有使用任何 Jev 輸出。

評測協議

開發劃分用於選模型;鎖定的測試劃分每個候選最多讀一次。每個數字都在 result.json 裡帶著套件 hash、程式碼 hash 和 git commit。我們對自己更早主張的更正見 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。

使用

uv run --extra serve python -m kev.serve --run jaredpalmer/kev-8b --port 8008      # KEV_DTYPE=bf16 on a 32 GB Mac

任何 TypeSafe 相容客戶端都可用:TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。

許可證

介面卡與指標頭為 Apache-2.0;Qwen3 基座為 Apache-2.0;資料集各有自己的許可證。