Kev-27B
モデル概要
Kev-27B は意思決定モデルです。1 つの文書(状態)と、それについての型付きの質問群を読み、各質問に添えられた選択肢上の較正された確率分布を、一度のフォワードパスで、テキストを生成せずに返します。最大 64k トークンの文書を分類・振り分け・トリアージ・検査し、しきい値をかけられる確率を必要とする開発者 —— たとえば不確かなケースを人によるレビューに回す —— に向けられています。TypeSafe の公開 System One API(POST /v1/systemone)を実装しているので、TypeSafe SDK が変更なしに動きます。このカードはバージョン 2 を記述しており、2026-09-30 にリリースされました: Qwen3.8-27B の完全重みファインチューニングをバージョン 1 と平均したものです。
モデルの詳細
| 開発 | Jared Palmer(github.com/jaredpalmer/kev) |
| モデル種別 | 意思決定モデル: 因果言語モデルのバックボーンを prefill-only で走らせ、選択肢上のポインタヘッドを備える |
| バックボーン | Qwen/Qwen3.8-27B(リビジョン 1d4bf0f2、Qwen の post-trained リリース): 64 層、48 が Gated DeltaNet(線形注意)で 16 が完全注意、隠れサイズ 5,120。すべてのバックボーン重みをファインチューニング |
| ヘッド | ポインタヘッド: 2 つの 5,120 → 256 射影が各選択肢の閉じトークンを質問の最終トークンに対して採点し、softmax が確率を与える |
| パラメータ | バックボーンに 25.6B(vision tower、LM head、multi-token-prediction 層は読み込まれない)、ヘッドに 2.6M |
| 精度 | bf16(51.3 GB のチェックポイント)。bf16 で提供 |
| コンテキスト | 最大 65,536 トークンの状態を提供し、質問ごとにさらに少なくとも 8,192 トークン。訓練の状態は最大 32,768 トークンでした。 |
| 検証済みコンテキスト長 | 65,536 トークン(「長文書」を参照) |
| 較正 | 1 つの温度、T = 1.32。head.pt に保存され、読み込み時に適用される |
| 言語 | 英語 |
| ライセンス | Apache-2.0(重みとヘッド)。ベースモデルは Apache-2.0 |
| バージョン | v2(Kev 1.0)、2026-09-30 リリース、jaredpalmer/kev-27b の main |
| 以前のバージョン | v1、同じベース上のランク 16 の LoRA アダプタ(T = 1.38)。タグ v1-lora。そのカードはそのタグの README |
入力。 状態(テキスト、またはラベル付きテキストとして描画された JSON オブジェクトか配列)と、任意の数の名前付き質問。各質問は 3 種のいずれかです:
| 種別 | 選択肢 | 出力 |
|---|---|---|
choice |
1–255 の名前付き選択肢、それぞれ任意の説明付き | 選択肢ごとの確率、最も可能性の高い選択肢、信頼度 |
score |
1–255 の順序付き段階 | 段階ごとの確率、期待段階指数 |
noul |
はい/いいえ、任意の説明付き | はいの確率 |
各質問は、共有された状態から続く自分の行として答えられるので、質問は互いに影響できません。状態は一度だけ計算され、キャッシュされます。
想定用途
- 文書に対する型付きの決定: 分類、ルーティング、トリアージ、抽出の選択、ポリシーと資格の検査、述べられた基準に対する提案回答の判定。
- 信頼度に基づいて行動するワークフロー: 確信のあるケースを自動化し、残りを待ち行列に入れる。しきい値はユーザー自身の業務のラベル付きサンプルで凍結する。
- System One エンドポイントの自己ホスト型 drop-in 代替。
範囲外の用途
- テキスト生成、チャット、要約、自由形式の質問応答。モデルは与えられた選択肢を採点するだけです。
- 人に対する法的、医療、金融、雇用、または同様の帰結を伴う、人によるレビューなしの完全自動の決定。
- 答えが状態になく一般知識でもない事実に依存する質問(モデルは何も調べられません)、および知識重視の試験(「限界」を参照)。
- 65,536 トークンを超える状態、英語以外の言語、80 GB クラスの GPU や約 96 GB のメモリの Mac より小さいハードウェア(「限界」を参照)。
使い方
Kev リポジトリで、B200、H200、または H100 80 GB の GPU 1 台で提供します。重みに 51 GB、サーバーに約 65.5 GB 常駐を使います。64k トークンの状態は H200 で 87.1 GB、32k トークンの状態は 78.7 GB がピークだったので、最長の状態は 80 GB 超を要します。
git clone https://github.com/jaredpalmer/kev.git && cd kev && uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-27b --port 8008 # v2 (this card)
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-27b@v1-lora --port 8008 # v1
Apple Silicon では、同じコマンドが MLX 経由で提供し(自動で選択)、完全な bf16 重みを保存されたまま、何もマージせずに読み込みます。この経路は 96–128 GB の Mac で動くと見込まれますが、このサイズではまだ実行されていません(「限界」を参照)。
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
response = client.system_one(
state="I was charged twice for order 1182. Please refund one of the charges.",
questions={
"team": Choice(instructions="Which team should handle this?",
criteria={"billing": "Charges and refunds", "shipping": "Deliveries", "returns": "Exchanges"}),
"urgent": Noul(instructions="Does this need a reply today?"),
},
)
print(response.choices["team"].choice, response.nouls["urgent"].noul)
較正された温度は既定で適用されます。KEV_TEMPERATURE=1.0 は生の確率を返します。サーバーは bf16、融合 DeltaNet カーネル、CUDA graphs を使います。KEV_DTYPE=fp32 は評価に使う正確な経路を選びます。
訓練データ
最大 32,768 トークンの状態を持つ、非公開の 145,840 レコード(337,130 質問)のコーパスで 1 エポック。その manifest だけが公開されています(GitHub リポジトリの evals/sft-v2-r22/manifest.json)。
| 構成要素 | レコード | 内容とラベル |
|---|---|---|
| Kev コーパス | 78,786 | Kev-27B v1 の訓練セット(10 の公開分類データセット、生成ポリシーとルールのレコード、日付演算と欠落証拠のケース、事実を埋め込んだ長い状態)。Kev のスキル(hard-v1)、開発者ツール(devtools-v1)、消費者苦情(documents-v1)スイートの訓練分割。各 500 レコードに上限した 24 の公開データセット。7 つの生成ファミリー(長文書、ツールルーティング、検索、意図、ルーブリック判定、棄権、数値推論) |
| ライセンス済みタスクファミリー | 24,000 | 商用利用を許すライセンスとそのままのラベルを持つ公開マルチタスクコレクションの 119 タスクファミリー。ファミリー一覧は公開されていない |
| 長い状態 | 3,200 | 8k–32k トークンの文書に埋め込んだ Kev コーパスの状態。ラベルは正確に継承 |
| 長文書 | 7,617 | コードが組み立てた文書、コードが計算したラベル |
| 分布外の決定 | 7,312 | さまざまなドメインの生成された決定 |
| トーン | 7,544 | 同じテキストを冷静に、いらだって、怒って書いた最小対 |
| プロンプトインジェクション | 2,699 | 間接プロンプトインジェクションの認識(防御的) |
| エージェントセッション | 4,875 | コードが生成したエージェントセッションログについての質問 |
| PII | 4,152 | コードが挿入した個人データの分類(すべて架空) |
| Grounding | 5,655 | ある主張が文書に支持されているか |
ソースとラベル。 公開データセットはこのカードのメタデータに列挙されています。2 つの開発者ツールソース CodeReviewer と FlakeFlagger は Zenodo 由来で、CodeReviewer の diff は許容的ライセンスのプロジェクトからのみ保持されています。生成テキストとラベルはコードかオープンウェイトモデル(GLM-5.3、DeepSeek-V4-Pro、Inkling、Mistral Large 3、gpt-oss-120b、MiMo-V2.6-Pro)から来ます。消費者苦情のラベルはオープンウェイトモデルから来て、クローズドモデルの判定と裁定でフィルタされます。Jev(TypeSafe のホスト型意思決定モデル)の出力は使用していません。
ライセンス。 上限した公開データセットのうち 4 つは share-alike です: ARC(CC-BY-SA-4.0)、HotpotQA(CC-BY-SA-4.0)、Natural Questions(CC-BY-SA-3.0)、SNLI(CC-BY-SA-4.0)。他は CC-BY-4.0、MIT、Apache-2.0 です。CFPB 苦情ナラティブは米国政府の著作物です。GLM-5.3 のライセンスは MIT 風で、超大規模な model-as-a-service 事業者に関する条件付きです。ソースごとのライセンス、リビジョン、帰属は構成要素の manifest に記録されています。
汚染スクリーニング。 訓練前に、すべてのレコードを 102 の評価分割(76,549 参照項目)と照合しました: すべての凍結 Kev スイート、非公開評価セット、JevBench の公開項目、下の eval 専用スイートです。正規化した文字列の完全一致、単語 8-gram の Jaccard 類似度 0.2 超、または包含 0.5 以上でレコードを除去し、6,388 の訓練レコードが除かれました。
訓練手順
- 完全重みファインチューニング。
Qwen/Qwen3.8-27Bから 8 台の NVIDIA H200 GPU(FSDP2)で 1 エポック。AdamW(β 0.9 / 0.999、weight decay 0.01)で、bf16 バックボーン上に fp32 のマスタ重みとモーメント。学習率はバックボーン 2e-6、ヘッド 1e-4、one-cycle スケジュールで 10 % ウォームアップ。勾配ノルムを 1.0 でクリップ。オプティマイザステップあたり 128 レコード(GPU あたり 8、蓄積 2 ステップ)、1,140 ステップ。シード 0。損失は各質問の選択肢上の交差エントロピーです(データがあるところではソフトターゲット)。選択肢順序はシャッフルされ、「none of the above」選択肢とディストラクタがランダムに挿入されます。状態が最大 8,192 トークンの choice レコードの 4 分の 1 は最小対も生みます: 「none of the above」選択肢付きの質問を、正解選択肢がある状態と除いた状態で 1 回ずつ。各状態は一度だけ実行され、その質問がそこから分岐します。 - 重み平均。 すべてのバックボーンテンソルを 0.85 × ファインチューニング済み重み + 0.15 × v1 の重み(v1 の LoRA アダプタを fp32 でベースにマージ)とし、fp32 で計算し、bf16 に一度だけ丸めます。ファインチューニング済みモデルのポインタヘッドは保持されます。比率は 6 つのブレンド(0.85 / 0.70 / 0.50、いずれかのヘッド付き)から開発データで選ばれました。
- 較正。 1 つの温度、T = 1.32。どちらの親も訓練していないホールドアウトデータセットの 648 質問で負の対数尤度を最小化します: transfer-r3 の較正分割(6 つの公開データセット、QNLI、SciQ、TweetEval-offensive、PAWS、MMLU、Emotion、および生成ポリシーレコードの 2 つのホールドアウトファミリー)からの 448 と、200 MMLU-Pro 質問(transfer-v9 開発)。どの訓練コーパスの分割も使われず、チェックが訓練データとの重複がないことを確認しました。
評価
方法論。 すべての比較は、同一項目での Kev-27B v1 に対するもので、各モデルは自身の提供温度です。テスト分割はこのチェックポイントのために一度だけ読まれました。transfer-v4 テストはロック済み(候補ごとに一度読む)で、事前に固定した水準(精度 ≥ 0.886、Brier ≤ 0.165)に対して判定されました。区間は、レコード全体をリサンプルする 95 % ペア付きブートストラップ(2,000 リサンプル)なので、状態を共有する質問は一緒に動きます。差はパーセンテージポイント(pp)です。スイート:
- breadth-v1: 5 領域(知識、言語、検索、ツール、芸術)の 14 のホールドアウト公開データセット。一度も訓練していない。
- tasksource-heldout-v1: ライセンス済み構成要素と同じマルチタスクコレクションの 24 のタスクファミリー全体。訓練からホールドアウト。
- hard-v1: プログラム的にラベル付けされたスキルレコード(長いポリシー、トレードオフ、確率、マルチホップ、日付と数値、判定、棄権)。テスト分割は訓練済みジェネレータのテンプレートをホールドアウトします。
- devtools-v1: ライセンス確認済み公開ソースからの開発者ツール決定(コードレビュー、コミットメッセージ、安全、flaky テスト)。
- documents-v1 / documents-v2: 米国消費者金融苦情ナラティブ(CFPB)。v2 は非公開のホールドアウトテストセット。
- transfer-v4: 6 つの未訓練公開ソースからの分布外決定と、ホールドアウトのポリシー構造。
- longdoc-v1: 最大 64k トークンの CUAD 商業契約と、生成した合意バンドル。
主要パネルは、このチェックポイントが作られる前に完成したラベル監査が不健全と判断した項目を除外します¹。どの除外も、両モデルから同じ行を除きます。
v1 との結果(テスト分割)。
| パネル(質問数) | Kev-27B v2 | Kev-27B v1 | Δ [95 % CI] |
|---|---|---|---|
| ホールドアウト公開データセット、breadth-v1、10 データセット (2,489) | 0.832 | 0.820 | +1.2 [+0.3, +2.2] |
| ホールドアウトのタスクファミリー、tasksource-heldout-v1、17 ファミリー (2,024) | 0.795 | 0.743 | +5.3 [+3.7, +6.8] |
| スキル、開発者ツール、文書、プール (2,795) | 0.889 | 0.800 | +8.9 [+7.5, +10.3] |
| hard-v1 (1,088) | 0.918 | 0.749 | +16.9 [+14.2, +19.8] |
| devtools-v1、audited ソース (771) | 0.825 | 0.789 | +3.6 [+1.3, +5.9] |
| documents-v1 (936) | 0.908 | 0.869 | +4.0 [+2.1, +5.9] |
| documents-v2、非公開ホールドアウト (953) | 0.921 | 0.881 | +4.0 [+2.0, +6.1] |
| breadth-v1、全 14 データセット (3,089) | 0.757 | 0.748 | +0.8 [−0.1, +1.8] |
| 分布外、transfer-v4 ロック済みテスト (656): 精度 | 0.8887 | 0.8963 | −0.8 [−2.0, +0.5] |
| 分布外、transfer-v4 ロック済みテスト: Brier / ≤ 5 % 誤りでの被覆 | 0.154 / 0.875 | 0.160 / 0.835 | – |
他の意思決定モデルとの比較(breadth-v1 テスト、全 14 データセット)を、コミュニティ Decision Index 0.2 のチャンス補正指数で採点します(データセットごとに (score − chance) / (1 − chance) を、各領域内で平均し、その後 100 × 5 領域の平均)。Jev は Vercel AI Gateway 経由、AutoJev-27B(denis-pplx/autojev-27b、同じベースの完全重みファインチューニング)は自身のサーバー経由で、それぞれ一度ずつ、同じ項目で照会しました。
| Kev-27B v2 | Kev-27B v1 | Jev | AutoJev-27B | |
|---|---|---|---|---|
| 指数 [95 % CI] | 52.3 [49.2, 55.4] | 50.2 [47.0, 53.2] | 54.0 [51.2, 57.0] | 50.0 [47.0, 53.3] |
v1 に対する指数差は +2.1 [−0.4, +4.6] です。Jev に対するペア付き区間は計算していません。
長文書(longdoc-v1 テストの CUAD 契約、トークン単位の状態長ごとの精度 / ECE):
| 状態長(質問数) | Kev-27B v2 | Kev-27B v1 |
|---|---|---|
| 8k 未満 (867) | 0.874 / 0.059 | 0.900 / 0.025 |
| 8k–16k (443) | 0.880 / 0.052 | 0.892 / 0.028 |
| 16k–32k (442) | 0.873 / 0.061 | 0.882 / 0.019 |
| 32k–64k (442) | 0.867 / 0.060 | 0.876 / 0.014 |
| すべて (2,194) | 0.874 / 0.053 | 0.890 / 0.007 |
すべての長さにわたる精度差: −1.6 [−3.0, −0.3]。生成した合意バンドル(2,400 質問)では両モデルが 1.000 を記録します。
コンテキスト長。 検証済みコンテキスト長: 65,536 トークン、提供上限。longdoc-v1 開発から(8k バケットからのペア付き CUAD 精度差、pp [95 % CI]: 16k +0.2 [−0.7, +1.2]、32k −0.2 [−1.2, +0.7]、64k −1.1 [−2.4, +0.0]。各 445–447 質問)。ルールはすべての Kev 1.0 サイズに適用したものと同じです: 検証済み長は、16,384 トークン以上から、それと 8,192 との間のすべてのバケットが許容差内にあるような最大バケットの公称サイズで、許容差内とは、8k バケットからの CUAD 精度差が、同じ契約・反復・質問でペアにされ、95 % 下限が少なくとも −3 pp で、すべてのレコードが答えられていることです。
較正(期待較正誤差、ECE、提供時。低いほど良い):
| パネル | Kev-27B v2 | Kev-27B v1 |
|---|---|---|
| breadth-v1 テスト、10 データセット | 0.015 | 0.013 |
| tasksource-heldout-v1 テスト | 0.049 | 0.051 |
| hard-v1 + devtools-v1 + documents-v1 テスト | 0.014 | 0.027 |
| transfer-v4 ロック済みテスト | 0.019 | 0.018 |
| CUAD 契約、longdoc-v1 テスト | 0.053 | 0.007 |
648 のフィット質問で、5 分割のグループ非交差交差検証が ECE を 0.048(生)から 0.038(アウトオブフォールド)に下げます。2 つの区間は重なります。温度の 90 % ブートストラップ区間は [1.20, 1.45] です。その両端で主要パネルは逆方向に動きます: breadth-v1 ECE は T = 1.20 で 0.026 に上がり、tasksource-heldout-v1 ECE は T = 1.45 で 0.067 に上がります。
その他の結果。
| スイート | Kev-27B v2 | Kev-27B v1 |
|---|---|---|
| transfer-v4 開発、精度 / Brier | 0.851 / 0.218 | 0.848 / 0.229 |
| 短い状態、transfer-r3 テスト (1,150) | 0.858 | 0.879 |
| devtools-v1 テスト、全ソース (1,071) | 0.790 | 0.711 |
| decision-v7 開発(v1 の訓練分布) | 0.865 | 0.866 |
| MMLU-Pro、10 択(transfer-v9 開発) | 0.675 | 0.665 |
| 答えられない項目を p ≥ 0.9 で答えた(低いほど良い) | 0.00 | 0.00 |
| SemIf (144) / WANLI-v2 (1,002) / TypeSafe(回答済み 89 行) | 0.965 / 0.756 / 0.854 | 0.972 / 0.745 / 0.865 |
| 訓練済みジェネレータのホールドアウト領域、精度 / ECE: ood-v2 (4,988) | 0.956 / 0.020 | 0.944 / 0.044 |
| agents-ood-v1 (2,084) | 0.988 / 0.032 | 0.967 / 0.137 |
| guardrails-ood-v1 (4,949) | 0.984 / 0.010 | 0.944 / 0.079 |
transfer-r3 テストは、較正プールと同じ 8 つのホールドアウトソースからの短い状態のパネルです。decision-v7 は v1 の訓練分布です。transfer-v9 は MMLU-Pro と、決め手の証拠を除いた項目を持ちます。SemIf(SemIf プロジェクトの手書きの決定)、WANLI-v2(WANLI テスト分割の自然言語推論対)、TypeSafe(TypeSafe ワークフローケースの SemIf の選択)は報告のみです: ラベル監査が、モデルを順位付けるには小さすぎる、飽和、または雑音が多いと判断しました。WANLI-v2 と TypeSafe は 2026-09-30 に評価として廃止されました(WANLI の対の約 4 分の 1 は 2 人の注釈者が別々にラベル付けし、gold はその 2 つのラベルの一方に設定。TypeSafe の gold は 2 つのクローズドなフロンティアモデルの平均回答で、チェックポイントを区別するには質問が少なすぎます)。それらの数値は記録として保たれます。
提供パリティ(H200、bf16 で融合カーネルと CUDA graphs、200 decision-v7 開発レコード / 280 質問):
| チェック | 結果 |
|---|---|
| 提供時 対 fp32 評価経路、max |Δp| | 0.0223、答えの変化なし |
| 質問 1 つだけ 対 リクエスト全体、max |Δp| | 0.0039、答えの変化なし |
| 8k / 32k / 64k トークンの状態での提供時 対 評価、max |Δp| | 0.0064 / 0.0095 / 0.0017、答えの変化なし |
| 64k トークンの状態でのモデル時間、新しい / キャッシュ済み状態 | 9.4 s / 733 ms |
| 常駐メモリ / 温かいキャッシュからの読み込み時間 | 65.5 GB / 17.6 s |
| 1 / 64 同時クライアントでのスループット | 21.1 / 36.4 リクエスト/秒 |
¹ 主要パネルから除外: 4 つの breadth-v1 データセット(routerbench、その状態には尋ねられた情報が欠ける。cfcolor と humicroedit、どのシステムでもチャンス。chessbench、どのシステムでも床)。無効または回復不能なラベルの 7 つの tasksource-heldout-v1 ファミリー(名前は非公開)。状態がラベルを決めない 2 つの devtools-v1 タスク(flakeflagger、コミット変更種別)。transfer-r3 の emotion ソース(遠いキーワードラベル)は「限界」の短い状態のパネルから除外されています。
限界とトレードオフ
- 選択。 リリースされたチェックポイントは、以前の候補のテスト結果が知られた後に選ばれ、同じテストセットで確認されました。テストの余裕は楽観的として扱ってください。
- 短い状態での利得はありません。 短い入力では v1 より良くありません: ロック済み transfer-v4 テストで −0.8 pp [−2.0, +0.5]、短い状態の開発パネル(
emotion抜きの transfer-v4 開発と transfer-r3 テスト)で −0.9 pp [−2.0, +0.1]、transfer-r3 テスト全体で −2.1 pp [−3.5, −0.8] です。 - 長い契約でより不正確で過信気味です。 CUAD では v1 より 1.6 pp 不正確で、ECE はどの長さでも v1 の 2 倍から 4 倍です(全体で 0.053 対 0.007)。CUAD の質問には誤った、または争いのある gold ラベルがいくつか含まれますが、差は長さを通じて一貫しています。契約レビューには、自分のラベル付き文書で温度を再フィットするか(
python -m kev.calibrate)、v1 を使ってください。 - 分布内の利得。 hard-v1、devtools-v1、documents-v1 の訓練分割は訓練データに入っており、ood-v2、agents-ood-v1、guardrails-ood-v1 スイートは、訓練データも生成したジェネレータのホールドアウト領域です。そこでの利得は、訓練済みファミリーのホールドアウト項目を測るもので、新しいタスクへの転移ではありません。
- 不明なベース訓練。 ベースは Qwen の post-trained リリースで、その訓練データは知られていないので、それとあらゆる評価の重複は排除できません。
- 知識。 知識はベースが決めます: MMLU-Pro は 0.675 で、同じ項目で Jev の 0.840 に対してです。
- 未訓練の長さ。 32k–64k トークンの状態は評価されました(longdoc-v1)が、訓練はされていません。
- 廃止されたスイート。 v1 を選ぶのに使ったサポートチケットスイート(scienthoon)は、v2 が作られる前に不健全として廃止されたので、v2 にはそれについての結果がありません。v2 の平均前のファインチューニング済み親は、そこで v1 より 5.5 pp [−7.8, −3.2] 低く採点しました。
- 温度の不確かさ。 温度の区間([1.20, 1.45])はテスト ECE を最大約 0.02 動かします。
- ハードウェア。 80 GB クラスのデータセンター GPU を必要とします(最長の状態では 80 GB 超)。MLX 経由の Apple Silicon: v2 の完全な bf16 重みは約 51 GB と作業メモリを要するので、64 GB の Mac はぎりぎりで、96–128 GB の Mac なら収まるはずです。これはより小さいモデルでの測定から見込まれるもので、大きい Mac ではまだ測定されていません: 完全重みの Kev-4B を同じ経路で読み込むと、その重みのサイズ(8.4 GB)がピークで、その答えは fp32 評価経路から 0.015 以内でした(
runs/mlx-full-4b)。v1(LoRA アダプタ、タグv1-lora)は、外部の貢献者によって 128 GB の M5 Max で MLX 経由で提供されました(PR #175): transfer-v4 開発で精度 0.849、公表値 0.848 に対して。アダプタのマージ中、定常 52 GB、ピーク 97 GB でした。
バイアス、リスク、倫理的考慮
- 較正された確率は根拠のない信頼を生みうる。温度は公開ホールドアウトデータセットでフィットされ、すべての業務に転移するわけではありません。しきい値を設定する前に、自分のデータのラベル付きサンプルで精度と較正を測定してください。
- 精度と較正はドメイン変化の下でずれます(たとえば長い契約で)。上の数値に頼るのではなく、本番の誤り率を監視してください。
- 人についての重大な自動決定に、人によるレビューなしで使わないでください。ベースモデルと訓練データ(他のモデルが生成したラベルを含む)のバイアスは測定されていません。
- 状態は個人データや機密データを含みうる。自己ホストは入力を自分のハードウェアに保ちます。サーバーは
KEV_API_KEYを設定しない限り開いているので、自分のアクセス制御とデータ取り扱いポリシーを適用してください。
計算
- ファインチューニング: 8 × NVIDIA H200 で 16.2 時間の訓練時間(129 GPU 時間)。再起動と評価を除く。
- 重み平均: CPU で約 6 分。
- 評価と提供のチェック: Modal 上の単一 H200 GPU。
来歴と再現性
- コード、スイート、評価レポート: github.com/jaredpalmer/kev。リリース数値:
runs/release/kev-27b-r23.json(scripts/release_numbers.py --release kev-27b-r23)。 - ファインチューニング: ラウンド 22 トライアル
r22-27b-lr2e6/00-trial-0(experiments/round22/lr2e6.json)、重み sha2563fa0182a…。ブレンド: ラウンド 23 アーム27b-k-w85(scripts/interpolate_checkpoint.py --toward、Hub リポジトリのinterpolation.json)、選択ルールと確認段階はexperiments/rounds/r23.json。結果はruns/r23-readout/、runs/r23-verdict/、runs/r23-breadth-report/、runs/serving-27b-r23*/。 - ブレンド元: v1(
jaredpalmer/kev-27b@01b81998、トライアルr6-27b-v2/01-trial-1)、現在タグv1-lora。 - リリース済み重み sha256
d27af6ab2be16824166ac639907b4dba40979ff338599c2872721aa6c5072022、head.ptsha2567968f17b03479c1ef9d1c0f3ab8a15e31ecb441cf40691b07ee945ab554d45ad(T = 1.3195)。重みは Hub コミット28be62e9で公開。 - 検証: H200 で Hub から匿名で読み込み、リリース前評価の logits を SemIf の 252/252 行と transfer-v4 開発の 764/764 行で正確に再現しました(
runs/release/kev-27b-r23-published.json、runs/release/kev-27b-r23-staging.json)。
引用
@misc{palmer2026kev27b,
title = {Kev-27B: a calibrated decision model on Qwen3.8-27B},
author = {Palmer, Jared},
year = {2026},
howpublished = {\url{https://huggingface.co/jaredpalmer/kev-27b}},
note = {Version 2, released 2026-09-30}
}
連絡先
質問と issue: github.com/jaredpalmer/kev/issues。