ドキュメント

Kev-0.6B (Qwen3)

前世代(Qwen3)。 Apple Silicon で高速な小型の選択肢として残されています(5 問のリクエストで 0.12 秒、Kev-0.8B では 0.33 秒)。精度が必要なら Kev-0.8B を使ってください。ロック済みテストでは、同じ項目でこのモデルに対し域外で 0.668 対 0.642 を記録します。重み: jaredpalmer/kev-0.6b。

Kev-0.6B は意思決定モデルです。1 つの文書(状態)と型付きの質問群を入力すると、質問ごとの確率分布が一度のフォワードパスで出てきます。テキスト生成は行いません。Qwen/Qwen3-0.6B-Base 上の LoRA アダプタ(r=16)とポインタヘッドで、TypeSafe の公開 /v1/systemone コントラクトを提供します。

Kev ファミリーの小型メンバー。 凍結されチェックサム付きの評価プロトコルの下で最良の 0.6B チェックポイントです。4B/8B のレシピのデータ(decision-v7)を lr 1e-4、3 つのシード(transfer 0.613 / 0.605 / 0.620)で訓練しました。これは 8 回の単一ノブ変異と、前のデータでの 3 シードが 0.61 より良いものを見つけられなかった後のことです。域外ではこれは 0.6B モデルです —— 精度が必要なら Kev-4B を使ってください。メモリやレイテンシが 4B を排除する場面ではこれを使い、自分のデータで測定してください。

  • Hub: jaredpalmer/kev-0.6b(本リポジトリ。トライアル v7-06b/02-trial-2、3 つのうちシード 2)
  • コード、スイート、結果、そして完全な研究ログ: github.com/jaredpalmer/kev —— PLAN.md(完全な記録は git タグ research-archive-2026-09-24)、runs/leaderboard.md、evals/v4/*/manifest.json を参照してください

Kev-0.5B 以降の変化

Kev-0.5B Kev-0.6B(本モデル)
バックボーン Qwen2.5-0.5B Qwen3-0.6B-Base
訓練レコード 9,000(6 ソース) 12,576(公開 10 ソース + policy 最小対 896 + ランダムなルール構造 60 件からのレコード 1,680)
none-of-the-above 拡張の修正のみ + 最小対: 同じ状態を、正解の選択肢がある版と除いた版で描画
分布内精度(decision-v4 dev) 0.712 0.801
分布外精度(transfer-v4 dev) 0.561 0.620
none 選択肢ありの精度 0.25(transfer-v1) 0.80
数値の背後のシード数 1 3(transfer 0.605–0.620)

同じ凍結された開発セットでの Jev(typesafe-ai/jev、Vercel AI Gateway 経由)は、分布内 0.845、分布外 0.857 です。このチェックポイントのソース別 transfer 精度: QNLI 0.85、SciQ 0.93、TweetEval-offensive 0.69、PAWS 0.59、Emotion 0.49、MMLU 0.50。ホールドアウトのポリシー構造はほぼチャンスレベルです。

既知の限界

  • 域外ではこれは 0.6B モデルです。 transfer 精度は、私たちが試したあらゆるハイパーパラメータ(8 回の単一ノブ変異、3 シード)を通じて約 0.60 で横ばいです。同じレシピは 4B で 0.72–0.75、8B で 0.74–0.77 に達します。このサイズではボトルネックはデータではなく容量です。
  • ホールドアウトのポリシー推論は失敗します: ルール構造が一度も訓練されていないプログラム的なポリシー対では、両方の兄弟が正解する割合は 6–11% です(Kev-4B 0.73、Jev 0.86)。
  • 順序のヘッジ: 日付演算を含む 3 段階の Score 質問で、中央の段階に潰れます。
  • 域外での確信ある誤り率は 11%(信頼度 ≥0.9 かつ誤り)。生の ECE は分布内 0.09、域外 0.15 です。確率は分布内では使えますが、それ以外では参考程度に扱ってください。
  • ロック済みテスト、一度だけ読取り(runs/locked/kev-06b-v7-ungated/): 分布内精度 0.808(Brier 0.266、ECE 0.089)、分布外 0.642(Brier 0.483、ECE 0.128、確信ある誤り 7.9%)。この分割は、このチェックポイントでは二度と読まれません。

アーキテクチャ

ブロック因果注意マスクを使う prefill-only の因果 LM です。共有の状態プレフィックス、質問ごとに 1 つの独立した分岐、選択肢境界トークン上のポインタ読み出しを備えます。1 つのリクエストに詰め込んだ質問は、単独で得られるのとちょうど同じ確率を得ます(測定された最大差 4e-6)。詳細はリポジトリの README にあります。

訓練

凍結スイート evals/v7/decision-v7(manifest がデータセットとベースモデルのリビジョンを固定)を使います。公開レコード 10,000(ソースごとに 1,000)、9 つのテンプレートファミリーにわたる policy 最小対レコード 896、ランダムに生成されたルール構造 60 件からのレコード 1,680。2 エポック、attention と MLP の射影に LoRA r=16 を lr 1e-4 で、ポインタヘッドはゼロから、選択肢分布に対する交差エントロピー、fp32 マスタ重み付きの bf16 autocast を 1 台の H100 で(約 12 分)。拡張: 選択肢の置換、none-of-the-above の挿入、ディストラクタ、Choice レコードの 25% に対する none 最小対。訓練に Jev の出力は使用していません。

評価プロトコル

開発分割がモデルを選びます。ロック済みテスト分割が存在し、昇格した候補ごとに最大 1 回だけ読まれます。上のすべての数値は、スイートハッシュ、コードハッシュ、git コミットを result.json に持ちます。比較にはレコードでクラスタリングしたペア付きブートストラップを使います。git タグ research-archive-2026-09-24 の PLAN.md(「Evidence and corrections」)に、私たち自身の以前の主張に対して行った訂正があります。

使い方

from typesafe import TypeSafeClient   # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")

リポジトリから uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008 で提供できます。

ライセンス

アダプタとヘッドは Apache-2.0。ベースモデルは Apache-2.0(Qwen3)。訓練データセットはそれぞれ独自のライセンスを持ちます。