ドキュメント

Kev-8B (Qwen3)

前世代(Qwen3)。 このチェックポイントは、Apple Silicon で高速な選択肢として残されています(attention のみのバックボーンが、パックされたフォワードを MPS 上でフルスピードで実行します)。精度と較正が必要なら Kev-9B を使ってください。ロック済みテストでは、同じ項目でこのモデルに対し域外で 0.837 対 0.780 を記録します。重み: jaredpalmer/kev-8b。

Kev-8B は意思決定モデルです。1 つの文書(状態)と型付きの質問群を入力すると、質問ごとの確率分布が一度のフォワードパスで出てきます。テキスト生成は行いません。Qwen/Qwen3-8B-Base(リビジョン 49e3418f)上の LoRA アダプタ(r=16)とポインタヘッドで、TypeSafe の公開 /v1/systemone コントラクトを提供します。

最も精度の高い Kev。 凍結されチェックサム付きのプロトコルの下で、あらゆるサイズを通じて最良のチェックポイントです。分布内精度が最良、分布外精度が最良(transfer-v4 dev で 0.796、Jev まで 6 ポイント差)、8B で任意の Kev 中最良のホールドアウトルール推論を備えます。同じレシピを 2 つのシードで実行: 0.796 / 0.774。このチェックポイントは、開発分割で選ばれたシードです。

  • Hub: jaredpalmer/kev-8b(本リポジトリ。トライアル v7-final/00-trial-0)
  • コード、スイート、ハッシュとペア付きブートストラップを含むすべてのトライアル: github.com/jaredpalmer/kev —— PLAN.md(完全な記録は git タグ research-archive-2026-09-24)、runs/leaderboard.md

結果(すべての行で同じ凍結項目)

| | Kev-0.5B(プロトタイプ) | Kev-0.6B | Kev-4B | Kev-8B | Jev | |—|—|—|—|—| | 分布内精度(decision-v4 dev、1,200 問) | 0.712 | 0.801 | 0.854 | 0.863 | 0.845 | | 分布外精度(transfer-v4 dev、560 問) | 0.561 | 0.620 | 0.790 | 0.796 | 0.857 | | 分布外 Brier | 0.50 | 0.536 | 0.328 | 0.337 | 0.211 | | 域外での確信ある誤り(p ≥ 0.9 かつ誤り) | – | 10.8% | 8.2% | 9.9% | 3.7% | | ホールドアウトのポリシー構造、両方の兄弟が正解 | – | 0.08 | 0.73 | 0.69 | 0.86 | | 選択肢順序の反転率 | 0.21 | 0.02 | 0.00 | 0.00 | 0.00 |

ソース別の分布外精度(Kev-8B / Jev): QNLI 0.91 / 0.93、SciQ 1.00 / 0.99、TweetEval-offensive 0.79 / 0.81、PAWS 0.78 / 0.79、MMLU 0.70 / 0.90、Emotion 0.56 / 0.59、deadline(3 段階の日付演算)0.60 / 0.93、(A and B) or not C 0.91 / 0.97、if A then not B else C 0.59 / 0.78。

シード: decision-v7 で 2 シード: transfer 0.796 / 0.774、ホールドアウトのルール対 0.69 / 0.64(Jev 0.86)。このチェックポイントはシード 0 です。decision-v7 で訓練しました(公開レコード 10k + 9 つのテンプレートファミリーにわたる policy レコード 896〔4 つの順序付き Score 閾値ファミリーを含む〕+ 否定が任意の位置に入るランダムなルール構造 60 件からのレコード 1,680)。開発/テスト項目は v4 とバイト単位で同一なので、ここでのすべての数値は以前のチェックポイントと比較できます。

ロック済みテスト、一度だけ読取り(runs/locked/kev-8b-v7-preview-ungated/): 分布内 0.870(Brier 0.193)、分布外 0.780(Brier 0.327、確信ある誤り 7.6%、ホールドアウト対 0.62)。この分割は、このチェックポイントでは二度と読まれません。

構築を通じて学んだこと

  • 域外では容量が支配します。 公開例と合成の予算を等しく保つと、0.6B → 4B は +14–19 pp、4B → 8B は +1–7 pp です。
  • ファインチューニングはベースの能力を侵食し、学習率がそれを制御します。 4B ベースを、文字読み出しでのゼロショットで評価すると、同じ MMLU 項目で 0.688、PAWS で 0.787 です。既定のレシピ(lr 2e-4)は 0.60–0.66 / 0.56–0.71 まで下がりました。lr を 5e-5 に下げるとその大半を取り戻し、これが私たちが見つけた最大のレシピ改善です。LoRA 対象モジュールを減らすこととランクを小さくすることの効果はより小さいです。
  • 公開訓練データを増やすと分布内精度が上がり transfer が下がります(4B で 10k 対 3.4k レコード: −3 pp)。知識 MCQ ソース(ARC、OpenBookQA、CommonsenseQA)は transfer を動かさずに分布内精度を 0.86 まで上げます。
  • プログラム的な対照ポリシー対は、訓練されたルール構造を教えます(両方正解 0.85–1.0)が、未見の構造への転移は部分的です(4B で 0.5–0.6、0.6B で 0.03–0.11)。

既知の限界

  • ホールドアウトのポリシー推論(未見のルール合成、猶予期間を含む日付演算)は Jev には遠く及びません。
  • 訓練に相当するものがない製品形の質問は保証されません。自分の入力で測定してください。
  • 域外の確率は使えますが較正されていません(生の ECE 0.128)。分布内でフィットした温度は転移しません。
  • 8B の fp32 は約 33 GB を必要とし、32 GB の Mac には収まりません。KEV_DTYPE=bf16(約 17 GB)なら収まります。訓練は 1 台の H100 で約 70 分かかりました。

訓練

凍結スイート evals/v6/decision-v6(開発/テストのバイトは v4 と同一)を使います。公開レコード 13,000(ソースごとに 1,000: v4 の 10 ソースに ARC-Challenge、OpenBookQA、CommonsenseQA を加えたもの)に、448 レコードのプログラム的なポリシー 2 アームを加えます。2 エポック、attention と MLP の射影に LoRA r=16、ポインタヘッドはゼロから、選択肢分布に対する交差エントロピー、lr 5e-5(OneCycle)、実効バッチ 8、fp32 マスタ重み付き bf16 autocast、勾配チェックポイント、1 台の H100(約 70 分)。拡張: 選択肢の置換、none-of-the-above の挿入、ディストラクタ、Choice レコードの 25% に対する none 最小対。訓練に Jev の出力は使用していません。

評価プロトコル

開発分割がモデルを選びます。ロック済みテスト分割は候補ごとに最大 1 回だけ読まれます。すべての数値は、スイートハッシュ、コードハッシュ、git コミットを result.json に持ちます。git タグ research-archive-2026-09-24 の PLAN.md(「Evidence and corrections」)に、私たち自身の以前の主張に対して行った訂正があります。

使い方

uv run --extra serve python -m kev.serve --run jaredpalmer/kev-8b --port 8008      # KEV_DTYPE=bf16 on a 32 GB Mac

TypeSafe 互換のクライアントならどれでも動きます: TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")。

ライセンス

アダプタとヘッドは Apache-2.0。Qwen3 ベースは Apache-2.0。データセットはそれぞれ独自のライセンスを持ちます。