Kev-8B (Qwen3)
上一代(Qwen3)。 这个 checkpoint 作为 Apple Silicon 上的快速选项保留(它只含注意力的主干在 MPS 上全速跑打包前向)。要准确率与校准请用 Kev-9B:在锁定测试上,同一批条目它域外得 0.837,而本模型得 0.780。权重:
jaredpalmer/kev-8b。
Kev-8B 是一个决策模型:一份文档(状态)和一组带类型的问题进去,每个问题一个概率分布出来,全在一次前向传播里完成。不生成文本。它是 Qwen/Qwen3-8B-Base(revision 49e3418f)上的 LoRA 适配器(r=16)加一个指针头,服务 TypeSafe 公开的 /v1/systemone 契约。
最准确的 Kev。 它是在一套冻结、带校验和的协议下任何规模里最好的 checkpoint:分布内准确率最好、域外准确率最好(transfer-v4 dev 上 0.796,距 Jev 六个点)、8B 里任何 Kev 中留出规则推理最好。同一配方在两个 seed 上:0.796 / 0.774;本 checkpoint 是在开发划分上选出的那个 seed。
- Hub:
jaredpalmer/kev-8b(本仓库;试验v7-final/00-trial-0) - 代码、套件、每次试验的 hash 与配对 bootstrap:github.com/jaredpalmer/kev ——
PLAN.md(完整记录在 git tagresearch-archive-2026-09-24)、runs/leaderboard.md
结果(每一行都是同一批冻结条目)
| Kev-0.5B(原型) | Kev-0.6B | Kev-4B | Kev-8B | Jev | |
|---|---|---|---|---|---|
| 分布内准确率(decision-v4 dev,1,200 q) | 0.712 | 0.801 | 0.854 | 0.863 | 0.845 |
| 域外准确率(transfer-v4 dev,560 q) | 0.561 | 0.620 | 0.790 | 0.796 | 0.857 |
| 域外 Brier | 0.50 | 0.536 | 0.328 | 0.337 | 0.211 |
| 域外自信错误(p ≥ 0.9 且答错) | – | 10.8% | 8.2% | 9.9% | 3.7% |
| 留出策略结构,两兄弟都答对 | – | 0.08 | 0.73 | 0.69 | 0.86 |
| 选项顺序翻转率 | 0.21 | 0.02 | 0.00 | 0.00 | 0.00 |
逐来源域外准确率(Kev-8B / Jev):QNLI 0.91 / 0.93、SciQ 1.00 / 0.99、TweetEval-offensive 0.79 / 0.81、PAWS 0.78 / 0.79、MMLU 0.70 / 0.90、Emotion 0.56 / 0.59、deadline(3 档日期算术)0.60 / 0.93、(A and B) or not C 0.91 / 0.97、if A then not B else C 0.59 / 0.78。
Seed:decision-v7 上两个 seed:transfer 0.796 / 0.774,留出规则对 0.69 / 0.64(Jev 0.86);本 checkpoint 是 seed 0。在 decision-v7 上训练(10k 公开记录 + 896 条策略记录,覆盖九个模板家族,含四个序数 Score 阈值家族 + 1,680 条来自 60 个随机规则结构的记录,取反可在任意位置);开发/测试条目与 v4 逐字节相同,所以这里每个数字都可与更早的 checkpoint 比较。
锁定测试,只读一次(runs/locked/kev-8b-v7-preview-ungated/):分布内 0.870(Brier 0.193),域外 0.780(Brier 0.327,自信错误 7.6%,留出对 0.62)。这个划分不会再为本 checkpoint 读取。
训练它时我们学到什么
- 域外由容量主导。 在公开样本与合成预算相同的情况下,0.6B → 4B 是 +14–19 pp;4B → 8B 是 +1–7 pp。
- 微调会侵蚀基座能力,而学习率控制着侵蚀程度。 4B 基座用字母读出做 zero-shot,在同一批 MMLU 条目上得 0.688、在 PAWS 上得 0.787;默认配方(lr 2e-4)训练后降到 0.60–0.66 / 0.56–0.71。把 lr 降到 5e-5 能恢复大部分,这是我们找到的最大单项配方改进;更少的 LoRA 目标模块和更小的 rank 帮助更小。
- 更多公开训练数据会提高分布内准确率、降低迁移(在 4B 上,10k 对 3.4k 条记录:−3 pp)。知识 MCQ 来源(ARC、OpenBookQA、CommonsenseQA)把分布内准确率提到 0.86,但不移动迁移。
- 程序化对比策略对能教会已训练的规则结构(两兄弟正确 0.85–1.0),但对未见结构的迁移只是部分有效(4B 上 0.5–0.6,0.6B 上 0.03–0.11)。
已知局限
- 留出策略推理(未见的规则组合、带宽限期的日期算术)距 Jev 很远。
- 没有训练类似物的产品形状问题没有保证;在你自己的输入上测量。
- 域外概率可用但未校准(原始 ECE 0.128);在分布内拟合的温度不迁移。
- 8B fp32 需要约 33 GB,装不进 32 GB Mac;
KEV_DTYPE=bf16(约 17 GB)可以。训练在一张 H100 上约 70 分钟。
训练
冻结套件 evals/v6/decision-v6(开发/测试字节与 v4 相同):13,000 条公开记录(每个来源 1,000:十个 v4 来源加 ARC-Challenge、OpenBookQA、CommonsenseQA)加两个程序化策略臂共 448 条记录,两个 epoch,LoRA r=16 作用于注意力与 MLP 投影,指针头从头训练,在选项分布上做交叉熵,lr 5e-5(OneCycle),有效 batch 8,bf16 autocast 配 fp32 主权重,梯度 checkpointing,一张 H100(约 70 分钟)。增强:选项置换、none-of-the-above 插入、干扰项,以及对 25% 的 Choice 记录做 none 最小对。训练没有使用任何 Jev 输出。
评测协议
开发划分用于选模型;锁定的测试划分每个候选最多读一次。每个数字都在 result.json 里带着套件 hash、代码 hash 和 git commit。我们对自己更早主张的更正见 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。
使用
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-8b --port 8008 # KEV_DTYPE=bf16 on a 32 GB Mac
任何 TypeSafe 兼容客户端都可用:TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。
许可证
适配器与指针头为 Apache-2.0;Qwen3 基座为 Apache-2.0;数据集各有自己的许可证。