文档导航

Kev-0.6B (Qwen3)

上一代(Qwen3)。 作为 Apple Silicon 上快速的小选项保留(每个五问题请求 0.12 s,而 Kev-0.8B 为 0.33 s)。要准确率请用 Kev-0.8B:在锁定测试上,同一批条目它域外得 0.668,而本模型得 0.642。权重:jaredpalmer/kev-0.6b。

Kev-0.6B 是一个决策模型:一份文档(状态)和一组带类型的问题进去,每个问题一个概率分布出来,全在一次前向传播里完成。不生成文本。它是 Qwen/Qwen3-0.6B-Base 上的 LoRA 适配器(r=16)加一个指针头,服务 TypeSafe 公开的 /v1/systemone 契约。

Kev 家族里的小成员。 它是在一套冻结、带校验和的评测协议下最好的 0.6B checkpoint:用 4B/8B 配方的数据(decision-v7)在 lr 1e-4 下、三个 seed(transfer 0.613 / 0.605 / 0.620),此前八次单旋钮变体和三个 seed 的上一版数据都没找到比 0.61 更好的。域外它就是个 0.6B 模型 —— 要准确率请用 Kev-4B;当内存或延迟排除了 4B 时用它,并在你自己的数据上测量。

  • Hub:jaredpalmer/kev-0.6b(本仓库;试验 v7-06b/02-trial-2,3 个 seed 中的 seed 2)
  • 代码、套件、结果和完整研究日志:github.com/jaredpalmer/kev —— 见 PLAN.md(完整记录在 git tag research-archive-2026-09-24)、runs/leaderboard.md 和 evals/v4/*/manifest.json

自 Kev-0.5B 以来的变化

Kev-0.5B Kev-0.6B(本模型)
主干 Qwen2.5-0.5B Qwen3-0.6B-Base
训练记录 9,000(六个来源) 12,576(十个公开来源 + 896 条策略最小对 + 1,680 条来自 60 个随机规则结构的记录)
none-of-the-above 仅增强修复 + 最小对:同一个 state 渲染两种版本,真选项在场与移除
分布内准确率(decision-v4 dev) 0.712 0.801
域外准确率(transfer-v4 dev) 0.561 0.620
none 选项在场时的准确率 0.25(transfer-v1) 0.80
数字背后的 seed 数 1 3(transfer 0.605–0.620)

Jev(typesafe-ai/jev,经 Vercel AI Gateway)在同一批冻结开发集上:分布内 0.845,域外 0.857。本 checkpoint 的逐来源迁移准确率:QNLI 0.85、SciQ 0.93、TweetEval-offensive 0.69、PAWS 0.59、Emotion 0.49、MMLU 0.50;留出策略结构接近随机。

已知局限

  • 域外它就是个 0.6B 模型。 在我们试过的每个超参数下迁移准确率都平在约 0.60(八次单旋钮变体、三个 seed)。同一配方在 4B 达到 0.72–0.75,在 8B 达到 0.74–0.77;在这个规模上瓶颈是容量,不是数据。
  • 留出策略推理失败:在规则结构从未训练过的程序化策略对上,两兄弟都答对的比例是 6–11%(Kev-4B 0.73,Jev 0.86)。
  • 序数对冲:在带日期算术的 3 档 Score 问题上,它会塌到中间档。
  • 域外自信错误率为 11%(置信度 ≥0.9 且答错);分布内原始 ECE 0.09,域外 0.15。概率在分布内可用;在其他地方当作参考。
  • 锁定测试,只读一次(runs/locked/kev-06b-v7-ungated/):分布内准确率 0.808(Brier 0.266,ECE 0.089),域外 0.642(Brier 0.483,ECE 0.128,自信错误 7.9%)。这个划分不会再为本 checkpoint 读取。

架构

只做 prefill 的因果 LM,带块因果注意力掩码:一个共享的 state 前缀,每个问题一条隔离分支,并在选项边界 token 上做指针读出。打包进一个请求的问题得到的概率与单独询问完全一致(实测最大差 4e-6)。细节见仓库 README。

训练

冻结套件 evals/v7/decision-v7(manifest 钉住数据集与基座模型 revision):10,000 条公开记录(每来源 1,000),896 条覆盖九个模板家族的策略最小对记录,以及 1,680 条来自 60 个随机生成规则结构的记录,两个 epoch,LoRA r=16 作用于注意力与 MLP 投影,lr 1e-4,指针头从头训练,在选项分布上做交叉熵,bf16 autocast 配 fp32 主权重,在一张 H100 上约 12 分钟。增强:选项置换、none-of-the-above 插入、干扰项,以及对 25% 的 Choice 记录做 none 最小对。训练没有使用任何 Jev 输出。

评测协议

开发划分用于选模型;存在一个锁定的测试划分,每个晋升候选最多读一次。上面每个数字都在 result.json 里带着套件 hash、代码 hash 和 git commit。比较使用按记录聚类的配对 bootstrap。我们对自己更早主张的更正见 git tag research-archive-2026-09-24 上的 PLAN.md(「Evidence and corrections」)。

使用

from typesafe import TypeSafeClient   # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")

在仓库里用 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008 服务。

许可证

适配器与指针头为 Apache-2.0。基座模型为 Apache-2.0(Qwen3)。训练数据集各有自己的许可证。