Kev-4B (Qwen3)
上一代(Qwen3)。 這個 checkpoint 作為 Apple Silicon 上的快速選項保留(它只含注意力的主幹在 MPS 上全速跑打包前向)。要準確率與校準請用 Kev-4B (Qwen3.5):在鎖定測試上,同一批條目它域外得 0.832,而本模型得 0.806。權重:
jaredpalmer/kev-4b@qwen3。
Kev-4B 是一個決策模型:一份文件(狀態)和一組帶型別的問題進去,每個問題一個機率分佈出來,全在一次前向傳播裡完成。不生成文本。它是 Qwen/Qwen3-4B-Base 上的 LoRA 介面卡(r=16)加一個指標頭,服務 TypeSafe 公開的 /v1/systemone 契約。
推薦的 Kev。 它是在一套凍結、帶校驗和的協議下、經過約 40 次受控 4B 試驗後最好的 4B checkpoint,也是第一個在同一批條目上域外距 Jev 七個點以內的 Kev。同一配方在三個 seed 上跑:transfer 0.773 / 0.790 / 0.770;本 checkpoint 是在開發劃分上選出的那個 seed(從不在鎖定測試上選)。
- Hub:
jaredpalmer/kev-4b,revision tagqwen3(試驗v7-rc3/01-trial-1);倉庫的 main revision 現在放的是 Qwen3.5 checkpoint - 程式碼、套件、每次試驗的 hash 與配對 bootstrap:github.com/jaredpalmer/kev ——
PLAN.md(完整記錄在 git tagresearch-archive-2026-09-24)、runs/leaderboard.md
結果(每一行都是同一批凍結條目)
| Kev-0.5B(原型) | Kev-0.6B | Kev-4B | Jev | |
|---|---|---|---|---|
| 分佈內準確率(decision-v4 dev,1,200 q) | 0.712 | 0.801 | 0.854 | 0.845 |
| 域外準確率(transfer-v4 dev,560 q) | 0.561 | 0.620 | 0.790 | 0.857 |
| 域外 Brier | 0.50 | 0.536 | 0.328 | 0.211 |
| 域外自信錯誤(p ≥ 0.9 且答錯) | – | 10.8% | 8.2% | 3.7% |
| 留出策略結構,兩兄弟都答對 | – | 0.08 | 0.73 | 0.86 |
| 選項順序翻轉率 | 0.21 | 0.07 | 0.06 | 0.00 |
逐來源域外準確率(Kev-4B / Jev):QNLI 0.89 / 0.93、SciQ 0.99 / 0.99、TweetEval-offensive 0.75 / 0.81、PAWS 0.72 / 0.79、MMLU 0.65 / 0.90、Emotion 0.66 / 0.59、deadline(3 檔日期算術)0.53 / 0.93、(A and B) or not C 0.97 / 0.97、if A then not B else C 0.88 / 0.78。
Seed:decision-v7 上三個 seed:transfer 0.773 / 0.790 / 0.770,留出規則對 0.62 / 0.73 / 0.67(Jev 0.86);本 checkpoint 是 seed 1,按開發集遷移準確率選出。在 decision-v7 上訓練(10k 公開記錄 + 896 條策略記錄,覆蓋九個模板家族,含四個序數 Score 閾值家族 + 1,680 條來自 60 個隨機規則結構的記錄,取反可在任意位置);開發/測試條目與 v4 逐位元組相同,所以這裡每個數字都可與更早的 checkpoint 比較。
鎖定測試,只讀一次(runs/locked/kev-4b-v7-preview-ungated/):分佈內 0.856(Brier 0.211),域外 0.806(Brier 0.294,自信錯誤 6.6%,留出對 0.66)。這個劃分不會再為本 checkpoint 讀取。
訓練它時我們學到什麼
- 域外由容量主導。 在公開樣本與合成預算相同的情況下,0.6B → 4B 是 +14–19 pp;4B → 8B 是 +1–7 pp。
- 微調會侵蝕基座能力,而學習率控制著侵蝕程度。 4B 基座用字母讀出做 zero-shot,在同一批 MMLU 條目上得 0.688、在 PAWS 上得 0.787;預設配方(lr 2e-4)訓練後降到 0.60–0.66 / 0.56–0.71。把 lr 降到 5e-5 能恢復大部分,這是我們找到的最大單項配方改進;更少的 LoRA 目標模組和更小的 rank 幫助更小。
- 更多公開訓練資料會提高分佈內準確率、降低遷移(在 4B 上,10k 對 3.4k 條記錄:−3 pp)。知識 MCQ 來源(ARC、OpenBookQA、CommonsenseQA)把分佈內準確率提到 0.86,但不移動遷移。
- 程式化對比策略對能教會已訓練的規則結構(兩兄弟正確 0.85–1.0),但對未見結構的遷移只是部分有效(4B 上 0.5–0.6,0.6B 上 0.03–0.11)。
已知侷限
- 留出策略推理(未見的規則組合、頻寬限期的日期算術)距 Jev 很遠。
- 沒有訓練類似物的產品形狀問題沒有保證:在 TypeSafe 文件的示例上(「我卡上有兩筆扣款」→ 是否存在賬單問題?)本 checkpoint 答 0.48(Kev-8B 0.95,Kev-0.6B 0.97),同時把退貨原因選對了(尺寸錯誤 0.53;Kev-8B 0.84;Kev-0.6B 偏好「none of the above」0.58)。在你自己的輸入上測量。
- 域外機率可用但未校準(原始 ECE 0.096);在分佈內擬合的溫度不遷移。
- 4B fp32 需要約 16 GB;在 32 GB Mac 上用
KEV_DTYPE=bf16。H100 上延遲約每打包請求 45 ms;M5 上幾百 ms。
訓練
凍結套件 evals/v4/decision-v4:10,000 條公開記錄(每個來源 1,000,十個來源)加兩個程式化策略臂共 448 條記錄,兩個 epoch,LoRA r=16 作用於注意力與 MLP 投影,指標頭從頭訓練,在選項分佈上做交叉熵,lr 5e-5(OneCycle),有效 batch 8,bf16 autocast 配 fp32 主權重,梯度 checkpointing,一張 H100(約 40 分鐘)。增強:選項置換、none-of-the-above 插入、干擾項,以及對 25% 的 Choice 記錄做 none 最小對。訓練沒有使用任何 Jev 輸出。
評測協議
開發劃分用於選模型;鎖定的測試劃分每個候選最多讀一次。每個數字都在 result.json 裡帶著套件 hash、程式碼 hash 和 git commit。我們對自己更早主張的更正見 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。
使用
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8008 # KEV_DTYPE=bf16 on a 32 GB Mac
任何 TypeSafe 相容客戶端都可用:TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。
許可證
介面卡與指標頭為 Apache-2.0;Qwen3 基座為 Apache-2.0;資料集各有自己的許可證。