文件導航

Kev-4B (Qwen3)

上一代(Qwen3)。 這個 checkpoint 作為 Apple Silicon 上的快速選項保留(它只含注意力的主幹在 MPS 上全速跑打包前向)。要準確率與校準請用 Kev-4B (Qwen3.5):在鎖定測試上,同一批條目它域外得 0.832,而本模型得 0.806。權重:jaredpalmer/kev-4b@qwen3。

Kev-4B 是一個決策模型:一份文件(狀態)和一組帶型別的問題進去,每個問題一個機率分佈出來,全在一次前向傳播裡完成。不生成文本。它是 Qwen/Qwen3-4B-Base 上的 LoRA 介面卡(r=16)加一個指標頭,服務 TypeSafe 公開的 /v1/systemone 契約。

推薦的 Kev。 它是在一套凍結、帶校驗和的協議下、經過約 40 次受控 4B 試驗後最好的 4B checkpoint,也是第一個在同一批條目上域外距 Jev 七個點以內的 Kev。同一配方在三個 seed 上跑:transfer 0.773 / 0.790 / 0.770;本 checkpoint 是在開發劃分上選出的那個 seed(從不在鎖定測試上選)。

  • Hub:jaredpalmer/kev-4b,revision tag qwen3(試驗 v7-rc3/01-trial-1);倉庫的 main revision 現在放的是 Qwen3.5 checkpoint
  • 程式碼、套件、每次試驗的 hash 與配對 bootstrap:github.com/jaredpalmer/kev —— PLAN.md(完整記錄在 git tag research-archive-2026-09-24)、runs/leaderboard.md

結果(每一行都是同一批凍結條目)

Kev-0.5B(原型) Kev-0.6B Kev-4B Jev
分佈內準確率(decision-v4 dev,1,200 q) 0.712 0.801 0.854 0.845
域外準確率(transfer-v4 dev,560 q) 0.561 0.620 0.790 0.857
域外 Brier 0.50 0.536 0.328 0.211
域外自信錯誤(p ≥ 0.9 且答錯) – 10.8% 8.2% 3.7%
留出策略結構,兩兄弟都答對 – 0.08 0.73 0.86
選項順序翻轉率 0.21 0.07 0.06 0.00

逐來源域外準確率(Kev-4B / Jev):QNLI 0.89 / 0.93、SciQ 0.99 / 0.99、TweetEval-offensive 0.75 / 0.81、PAWS 0.72 / 0.79、MMLU 0.65 / 0.90、Emotion 0.66 / 0.59、deadline(3 檔日期算術)0.53 / 0.93、(A and B) or not C 0.97 / 0.97、if A then not B else C 0.88 / 0.78。

Seed:decision-v7 上三個 seed:transfer 0.773 / 0.790 / 0.770,留出規則對 0.62 / 0.73 / 0.67(Jev 0.86);本 checkpoint 是 seed 1,按開發集遷移準確率選出。在 decision-v7 上訓練(10k 公開記錄 + 896 條策略記錄,覆蓋九個模板家族,含四個序數 Score 閾值家族 + 1,680 條來自 60 個隨機規則結構的記錄,取反可在任意位置);開發/測試條目與 v4 逐位元組相同,所以這裡每個數字都可與更早的 checkpoint 比較。

鎖定測試,只讀一次(runs/locked/kev-4b-v7-preview-ungated/):分佈內 0.856(Brier 0.211),域外 0.806(Brier 0.294,自信錯誤 6.6%,留出對 0.66)。這個劃分不會再為本 checkpoint 讀取。

訓練它時我們學到什麼

  • 域外由容量主導。 在公開樣本與合成預算相同的情況下,0.6B → 4B 是 +14–19 pp;4B → 8B 是 +1–7 pp。
  • 微調會侵蝕基座能力,而學習率控制著侵蝕程度。 4B 基座用字母讀出做 zero-shot,在同一批 MMLU 條目上得 0.688、在 PAWS 上得 0.787;預設配方(lr 2e-4)訓練後降到 0.60–0.66 / 0.56–0.71。把 lr 降到 5e-5 能恢復大部分,這是我們找到的最大單項配方改進;更少的 LoRA 目標模組和更小的 rank 幫助更小。
  • 更多公開訓練資料會提高分佈內準確率、降低遷移(在 4B 上,10k 對 3.4k 條記錄:−3 pp)。知識 MCQ 來源(ARC、OpenBookQA、CommonsenseQA)把分佈內準確率提到 0.86,但不移動遷移。
  • 程式化對比策略對能教會已訓練的規則結構(兩兄弟正確 0.85–1.0),但對未見結構的遷移只是部分有效(4B 上 0.5–0.6,0.6B 上 0.03–0.11)。

已知侷限

  • 留出策略推理(未見的規則組合、頻寬限期的日期算術)距 Jev 很遠。
  • 沒有訓練類似物的產品形狀問題沒有保證:在 TypeSafe 文件的示例上(「我卡上有兩筆扣款」→ 是否存在賬單問題?)本 checkpoint 答 0.48(Kev-8B 0.95,Kev-0.6B 0.97),同時把退貨原因選對了(尺寸錯誤 0.53;Kev-8B 0.84;Kev-0.6B 偏好「none of the above」0.58)。在你自己的輸入上測量。
  • 域外機率可用但未校準(原始 ECE 0.096);在分佈內擬合的溫度不遷移。
  • 4B fp32 需要約 16 GB;在 32 GB Mac 上用 KEV_DTYPE=bf16。H100 上延遲約每打包請求 45 ms;M5 上幾百 ms。

訓練

凍結套件 evals/v4/decision-v4:10,000 條公開記錄(每個來源 1,000,十個來源)加兩個程式化策略臂共 448 條記錄,兩個 epoch,LoRA r=16 作用於注意力與 MLP 投影,指標頭從頭訓練,在選項分佈上做交叉熵,lr 5e-5(OneCycle),有效 batch 8,bf16 autocast 配 fp32 主權重,梯度 checkpointing,一張 H100(約 40 分鐘)。增強:選項置換、none-of-the-above 插入、干擾項,以及對 25% 的 Choice 記錄做 none 最小對。訓練沒有使用任何 Jev 輸出。

評測協議

開發劃分用於選模型;鎖定的測試劃分每個候選最多讀一次。每個數字都在 result.json 裡帶著套件 hash、程式碼 hash 和 git commit。我們對自己更早主張的更正見 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。

使用

uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8008      # KEV_DTYPE=bf16 on a 32 GB Mac

任何 TypeSafe 相容客戶端都可用:TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。

許可證

介面卡與指標頭為 Apache-2.0;Qwen3 基座為 Apache-2.0;資料集各有自己的許可證。