ドキュメント

Kev-4B (Qwen3)

前世代(Qwen3)。 このチェックポイントは、Apple Silicon で高速な選択肢として残されています(attention のみのバックボーンが、パックされたフォワードを MPS 上でフルスピードで実行します)。精度と較正が必要なら Kev-4B(Qwen3.5) を使ってください。ロック済みテストでは、同じ項目でこのモデルに対し域外で 0.832 対 0.806 を記録します。重み: jaredpalmer/kev-4b@qwen3。

Kev-4B は意思決定モデルです。1 つの文書(状態)と型付きの質問群を入力すると、質問ごとの確率分布が一度のフォワードパスで出てきます。テキスト生成は行いません。Qwen/Qwen3-4B-Base 上の LoRA アダプタ(r=16)とポインタヘッドで、TypeSafe の公開 /v1/systemone コントラクトを提供します。

推奨される Kev。 約 40 回の管理された 4B トライアルの後、凍結されチェックサム付きのプロトコルの下で最良の 4B チェックポイントであり、同じ項目で域外において Jev まで 7 ポイント以内に入った最初の Kev です。同じレシピを 3 シードで実行: transfer 0.773 / 0.790 / 0.770。このチェックポイントは、開発分割で選ばれたシードです(ロック済みテストでは決して選んでいません)。

  • Hub: jaredpalmer/kev-4b、リビジョンタグ qwen3(トライアル v7-rc3/01-trial-1)。リポジトリの main リビジョンは現在 Qwen3.5 のチェックポイントを保持しています
  • コード、スイート、ハッシュとペア付きブートストラップを含むすべてのトライアル: github.com/jaredpalmer/kev —— PLAN.md(完全な記録は git タグ research-archive-2026-09-24)、runs/leaderboard.md

結果(すべての行で同じ凍結項目)

Kev-0.5B(プロトタイプ) Kev-0.6B Kev-4B Jev
分布内精度(decision-v4 dev、1,200 問) 0.712 0.801 0.854 0.845
分布外精度(transfer-v4 dev、560 問) 0.561 0.620 0.790 0.857
分布外 Brier 0.50 0.536 0.328 0.211
域外での確信ある誤り(p ≥ 0.9 かつ誤り) – 10.8% 8.2% 3.7%
ホールドアウトのポリシー構造、両方の兄弟が正解 – 0.08 0.73 0.86
選択肢順序の反転率 0.21 0.07 0.06 0.00

ソース別の分布外精度(Kev-4B / Jev): QNLI 0.89 / 0.93、SciQ 0.99 / 0.99、TweetEval-offensive 0.75 / 0.81、PAWS 0.72 / 0.79、MMLU 0.65 / 0.90、Emotion 0.66 / 0.59、deadline(3 段階の日付演算)0.53 / 0.93、(A and B) or not C 0.97 / 0.97、if A then not B else C 0.88 / 0.78。

シード: decision-v7 で 3 シード: transfer 0.773 / 0.790 / 0.770、ホールドアウトのルール対 0.62 / 0.73 / 0.67(Jev 0.86)。このチェックポイントはシード 1 で、開発 transfer 精度で選ばれました。decision-v7 で訓練しました(公開レコード 10k + 9 つのテンプレートファミリーにわたる policy レコード 896〔4 つの順序付き Score 閾値ファミリーを含む〕+ 否定が任意の位置に入るランダムなルール構造 60 件からのレコード 1,680)。開発/テスト項目は v4 とバイト単位で同一なので、ここでのすべての数値は以前のチェックポイントと比較できます。

ロック済みテスト、一度だけ読取り(runs/locked/kev-4b-v7-preview-ungated/): 分布内 0.856(Brier 0.211)、分布外 0.806(Brier 0.294、確信ある誤り 6.6%、ホールドアウト対 0.66)。この分割は、このチェックポイントでは二度と読まれません。

構築を通じて学んだこと

  • 域外では容量が支配します。 公開例と合成の予算を等しく保つと、0.6B → 4B は +14–19 pp、4B → 8B は +1–7 pp です。
  • ファインチューニングはベースの能力を侵食し、学習率がそれを制御します。 4B ベースを、文字読み出しでのゼロショットで評価すると、同じ MMLU 項目で 0.688、PAWS で 0.787 です。既定のレシピ(lr 2e-4)は 0.60–0.66 / 0.56–0.71 まで下がりました。lr を 5e-5 に下げるとその大半を取り戻し、これが私たちが見つけた最大のレシピ改善です。LoRA 対象モジュールを減らすこととランクを小さくすることの効果はより小さいです。
  • 公開訓練データを増やすと分布内精度が上がり transfer が下がります(4B で 10k 対 3.4k レコード: −3 pp)。知識 MCQ ソース(ARC、OpenBookQA、CommonsenseQA)は transfer を動かさずに分布内精度を 0.86 まで上げます。
  • プログラム的な対照ポリシー対は、訓練されたルール構造を教えます(両方正解 0.85–1.0)が、未見の構造への転移は部分的です(4B で 0.5–0.6、0.6B で 0.03–0.11)。

既知の限界

  • ホールドアウトのポリシー推論(未見のルール合成、猶予期間を含む日付演算)は Jev には遠く及びません。
  • 訓練に相当するものがない製品形の質問は保証されません。TypeSafe ドキュメントの例(「カードに 2 回請求が来ている」→ 請求の問題か?)では、このチェックポイントは 0.48 と答えます(Kev-8B 0.95、Kev-0.6B 0.97)。一方で返品理由は正しく選びます(誤ったサイズ 0.53、Kev-8B 0.84、Kev-0.6B は「none of the above」を好む 0.58)。自分の入力で測定してください。
  • 域外の確率は使えますが較正されていません(生の ECE 0.096)。分布内でフィットした温度は転移しません。
  • 4B の fp32 は約 16 GB を必要とします。32 GB の Mac では KEV_DTYPE=bf16 を使ってください。H100 でのレイテンシはパックされたリクエストあたり約 45 ms、M5 では数百 ms です。

訓練

凍結スイート evals/v4/decision-v4 を使います。公開レコード 10,000(ソースごとに 1,000、10 ソース)に、448 レコードのプログラム的なポリシー 2 アームを加えます。2 エポック、attention と MLP の射影に LoRA r=16、ポインタヘッドはゼロから、選択肢分布に対する交差エントロピー、lr 5e-5(OneCycle)、実効バッチ 8、fp32 マスタ重み付き bf16 autocast、勾配チェックポイント、1 台の H100(約 40 分)。拡張: 選択肢の置換、none-of-the-above の挿入、ディストラクタ、Choice レコードの 25% に対する none 最小対。訓練に Jev の出力は使用していません。

評価プロトコル

開発分割がモデルを選びます。ロック済みテスト分割は候補ごとに最大 1 回だけ読まれます。すべての数値は、スイートハッシュ、コードハッシュ、git コミットを result.json に持ちます。git タグ research-archive-2026-09-24 の PLAN.md(「Evidence and corrections」)に、私たち自身の以前の主張に対して行った訂正があります。

使い方

uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8008      # KEV_DTYPE=bf16 on a 32 GB Mac

TypeSafe 互換のクライアントならどれでも動きます: TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。

ライセンス

アダプタとヘッドは Apache-2.0。Qwen3 ベースは Apache-2.0。データセットはそれぞれ独自のライセンスを持ちます。