ドキュメント

Kev 1.0

Kev 1.0 は Kev ファミリー全体の最初のバージョン付きリリースです。文書と型付きの質問群を読み、選択肢上の較正された確率を一度のフォワードパスで返す 4 つの意思決定モデルで、TypeSafe の System One API の背後にあります。この中で新たに訓練されたものはありません。次の世代の Kev が比較される対象となるチェックポイント、モデルカード、評価スイート、提供コードを固定し、すべての Hub リポジトリに同じタグ(v1.0)を付けます。

1.0 の内容

モデル Hub リポジトリ 重みリビジョン 形態 ベース 温度 検証済みコンテキスト
Kev-0.8B jaredpalmer/kev-0.8b 9a45d25e LoRA アダプタ + ヘッド Qwen3.5-0.8B-Base(Apache-2.0) 2.35 8,192 トークン
Kev-4B jaredpalmer/kev-4b 139fdd94 LoRA アダプタ + ヘッド Qwen3.5-4B-Base(Apache-2.0) 2.41 8,192 トークン
Kev-9B (v2) jaredpalmer/kev-9b b5d8c18e LoRA アダプタ + ヘッド Qwen3.5-9B-Base(Apache-2.0) 2.19 8,192 トークン
Kev-27B (v2) jaredpalmer/kev-27b 28be62e9 完全な bf16 重み(51 GB)+ ヘッド Qwen3.8-27B、post-trained(Apache-2.0) 1.32 65,536 トークン

主要な数値(fp32 評価経路、各モデルは出荷時の温度。transfer-v4 テストはロック済みで、モデルごとに一度だけ読まれました):

Kev-0.8B Kev-4B Kev-9B Kev-27B Jev
ホールドアウトデータセット: breadth-v1 テスト、チャンス補正指数 23.3 38.0 41.0 52.3 54.0
分布外: transfer-v4 開発精度 0.648 0.817 0.820 0.851 0.857
分布外: transfer-v4 ロック済みテスト精度 / Brier 0.697 / 0.397 0.838 / 0.224 0.852 / 0.199 0.889 / 0.154 –
スキル: hard-v1 テスト 0.665 0.803 0.834 0.918 –
開発者ツール: devtools-v1 テスト、全ソース 0.637 0.756 0.791 0.790 –
実文書: documents-v1 テスト 0.851 0.903 0.900 0.908 –
MMLU-Pro(transfer-v9 開発) 0.230 0.565 0.590 0.675 0.840

hard-v1、devtools-v1、documents-v1 には、すべての Kev が訓練した訓練分割があります。つまりそれらの行は、訓練されたファミリーのホールドアウト項目を測っており、転移ではありません。breadth-v1 と transfer-v4 の行は、どの Kev も訓練していないデータセットです。Jev は開発分割と breadth-v1 テストでのみ読まれました。すべての数値は docs/claims.json を通じてコミット済みのレポートに辿れます。残りはモデルカード(docs/model-cards/)に区間付きであります。

前回のファミリーリリース以降の変化

2026-09-24 に現行ファミリー向けに最初に組み立てられた GitHub リリース kev-family(Kev-27B v1、Kev-9B v1、そしてここにあるのと同じ Kev-4B と Kev-0.8B)から測ります。その 2026-09-30 の更新(Kev-27B v2、Kev-9B v2)もここに挙げます。1.0 は、それらがバージョン付きリリースの一部になる場所だからです。

  • Kev-27B v2: 完全な重み。 Qwen3.8-27B のすべての重みを 145,840 レコードのコーパスで 1 エポックファインチューニングし、その後 v1 と 0.85 / 0.15 で平均しました。テストでの v1 比: ホールドアウトデータセット +1.2 pp [+0.3, +2.2]、ホールドアウトのタスクファミリー +5.3 [+3.7, +6.8]、スキル・ツール・文書 +8.9 [+7.5, +10.3]。ロック済みの分布外テストは 0.889 対 0.896、Brier は 0.154 対 0.160。長い契約ではより不正確で過信気味です(CUAD ECE 0.053 対 0.007)。v1 は jaredpalmer/kev-27b@v1-lora にあります。
  • Kev-9B v2。 v1 に、Kev-4B と Kev-0.8B がすでに持っていた文書とスキルのデータで 1 エポックを加えたものです。テストでの v1 比: hard-v1 + devtools-v1 +18.7 pp [+16.7, +20.8]、documents-v1 +7.1 [+4.7, +9.2]。ロック済みの分布外テストでは同等(どちらも 0.852)で、Brier は 0.199 対 0.224。v1 は jaredpalmer/kev-9b@v1 にあります。
  • 無言の切り詰めを廃止。 サーバーは以前、上限を超える状態を何も言わずに切っていました。今は 65,536 トークンを超える状態を、トークン数と上限を明示する 422 で拒否します。KEV_TRUNCATE_STATES=1 で切り詰めに戻せ、そのようなサーバーからの応答はどれも truncated と言います。deploy と fine-tune のスキルは KEV_REF をこの修正と下記の長文書・MLX の変更を含むコミット(71d4829)に固定し、Space は修正後に再公開されました。
  • あらゆるサイズで長文書。 評価経路は長い行に対して数学カーネル上で fp32 の attention を保っていたため、Kev-0.8B、4B、9B は 32k–64k トークンの状態で GPU メモリを使い果たしました。長い行は今、fp32 でメモリ効率の良いカーネルを実行します: Kev-4B は H100 で重みとは別に 17.2 GiB を使い、61k トークンの状態を 17.2 秒で読み、短い行は logits をビット単位で保ちます。これが上の検証済みコンテキスト長を測定可能にしています。
  • Apple Silicon。 MLX バックエンドは完全重みのチェックポイントを保存されたまま、マージせずに読み込みます。これにより Kev-27B に Mac 経路ができます(約 51 GB と作業メモリを要すると見込まれますが、そのサイズではまだ実行していません)。長い状態は 1,024 トークンずつ prefill され、キャッシュはパスの前に退避するので、Kev-4B は 32 GB の M5 で 65,000 トークンの状態をピーク 13.0 GB で提供します(新規 84.5 秒、キャッシュ 716 ms)。
  • カーネルの来歴。 すべての評価レポートとトライアルが、その logits が依存するカーネル一式(パッケージ版、GPU、dtype、attention と DeltaNet の実装)を記録するようになりました。評価イメージのカーネル変更が、Kev 自身のコードを変えずに Kev-27B v1 の読みを確率で 0.03–0.06 動かすと分かった後です。
  • 評価監査。 3 つのスイートが、モデル選択に対して不健全として削除されました: scienthoon(テンプレート化されたチケット、テキストが答えられない質問が 1 つ)、WANLI-v2 / WANLI-v1(gold ラベルの 4 分の 1 が、意見の食い違う 2 人の注釈者のどちらか)そして TypeSafe の公開 eval(gold が 2 つのクローズドモデル、質問が少なすぎる)。主要なパネルは、監査が答えられないまたは未ラベルとした項目を除外します。それらのスイートに関する過去リリースの数値は各記録に残され、1.0 のカードにはありません。
  • 較正。 Kev-4B と Kev-0.8B は、訓練データのホールドアウト項目でフィットした温度を出荷します。ホールドアウトデータセットでの登録済み再フィットを両方について評価しましたが、どちらにも採用しませんでした: Kev-4B を改善せず(Brier 差 −0.0001 [−0.0005, +0.0003])、Kev-0.8B は文書とスキルのファミリーで登録済み許容差を超えて較正を悪化させました。Kev-9B と Kev-27B はすでにホールドアウトデータセットの温度を出荷しています。
  • 訓練データを公開。 documents-v1 と hard-v1 の訓練分割が jaredpalmer/kev-suites データセットにあり、小さいモデルの訓練データを取得してハッシュ確認できます。
  • 検証済みコンテキスト長。 各カードが今、CUAD 契約での精度が 8k トークンの同じモデルに対して 3 pp 以内(95 % 下限)に収まる最長の状態を記します。Kev-27B は提供上限の 65,536 トークンまで保ちます(その 64k 下限は −2.4 pp)。Kev-0.8B、4B、9B は訓練された 8,192 のみを検証します: いずれも 16k ですでに許容差を外しており(下限 −8.5、−3.4、−3.7 pp)、8k トークンを超えると長文書での答えは測定に覆われません。
  • 正式なモデルカード。 4 つのカードはすべて 1 つの構成に従います: 概要、詳細、想定用途と範囲外用途、使い方、訓練データと手順、評価、限界、リスク、計算、来歴。

既知の限界

  • 分布内の利得。 昨年の大きな利得は、訓練分割が訓練データに入っているスイート上のものです。どの Kev も訓練していないデータセットでは、Kev-27B は breadth-v1 テストで Jev より 1.7 指数ポイント低く、より小さいサイズは 13–31 ポイント低いです。
  • 未訓練の長さ。 Kev-0.8B、4B、9B は最大 7,552 トークンの状態で、Kev-27B は最大 32,768 で訓練しました。サーバーは 65,536 を受け付けます。提供上限ではなく、検証済みコンテキスト長を使ってください。
  • 長い契約での Kev-27B は v1 より不正確で過信気味です(CUAD テスト ECE 0.053 対 0.007)。自分の文書で温度を再フィットするか、契約レビューには @v1-lora を使ってください。
  • Kev-0.8B とツールルーティング。 その When2Call 精度は、文書とスキルの段階の後でチャンスを下回りました(テストで 0.133)。ツール呼び出しのルーティングには使わないでください。
  • 日付演算 は 27B 未満のどのサイズでも最も弱いファミリーです(deadline ポリシー精度 0.35 / 0.65 / 0.725 対 Jev の 0.95)。KEV_DATE_FACTS=1 が助けになります。
  • 知識 はベースが決めます(MMLU-Pro 0.230–0.675 対 Jev の 0.840)。
  • Mac での Kev-9B は測定されておらず、Mac での Kev-27B は 96–128 GB に収まると見込まれますが、実行はされていません。
  • 選択。 Kev-27B v2 と Kev-9B v2 は、以前の開発読みを知った上で監査済みルールの下で再選択されました。それらのテストの余裕は楽観的です。
  • モデルごとに 1 つの温度 は信頼度を並べ替えられないので、5 % の誤り予算では、これらのモデルは域外で Jev より少ない決定しか自動化できません。

実行方法

git clone https://github.com/jaredpalmer/kev.git && cd kev && uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b@v1.0 --port 8009    # CUDA, or MLX on Apple Silicon

リリースの tarball から:

shasum -a 256 -c SHA256SUMS.txt
tar -xzf kev-4b.tar.gz
uv run --extra serve python -m kev.serve --run kev-4b --port 8009

TypeSafe SDK はそのまま動きます: TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8009", model="kev-latest")。Kev-27B は B200、H200、または H100 80 GB が 1 台必要です: --run jaredpalmer/kev-27b@v1.0。Modal で HTTPS エンドポイントをデプロイするには skills/kev-deploy を参照してください。

アセット

各 tarball は、重みリビジョン時点の Hub 上のままの 1 つのチェックポイント(LoRA アダプタ、温度入りの head.pt、トークナイザファイル、訓練トライアルの result.json、provenance.json、training_config.json、training_metrics.json とログ)、README.md としての Kev 1.0 モデルカード、locked_test.json としてのロック済み transfer-v4 読みを含みます。これらは docs/releases/kev-1.0-assets.json から scripts/build_release_assets.py でビルドされ、再ビルドすると同じバイトになります。中のすべてのファイルの日付は 2026-10-01 00:00 UTC で、kev.serve はこれを展開済みチェックポイントのリリース日として報告します。2026-10-01 に最初に添付された tarball はファイルの日付を 1970-01-01 にしていたため、kev.serve は 1969-12-31 を報告しました。同日にこれらと置き換えられました。重みとその他すべてのファイルはバイト単位で同一で、変わったのは tarball のハッシュだけです。

ファイル SHA-256 チェックポイント adapter / head SHA-256
kev-0.8b.tar.gz (46 MB) 0ae144c7675f0c3f333be0bb878a0f202ab9e6fa84169fb7cb16efe6176c1ef1 jaredpalmer/kev-0.8b@9a45d25e 9b908623… / f400bd12…
kev-4b.tar.gz (131 MB) 2e707e2ebd08980dc7881222b7024cea5606401441c1a086afb170ae7784201c jaredpalmer/kev-4b@139fdd94 90e81735… / dd633435…
kev-9b.tar.gz (172 MB) acd13320b7d1b052ce989f19ca9d1d9ba5219b8beced0ee67337908aef1deb3f jaredpalmer/kev-9b@b5d8c18e 2b2a70cf… / 8e1dab2c…

Kev-27B は添付されていません。その 51 GB の重みは GitHub のアセットあたり 2 GB の上限を超えているためです。Hub からダウンロードしてください: jaredpalmer/kev-27b@v1.0(重みコミット 28be62e9、head.pt 7968f17b…)。

すべての Hub リポジトリで、v1.0 タグは Kev 1.0 カードをアップロードしたコミットを指します。そのコミットは README.md だけを変更したので、その重みは最初の表の重みリビジョンと同じバイトです: kev-0.8b bf75a6a8、kev-4b 6cfce5c2、kev-9b db029f08、kev-27b af0e6d55。

リリース計画(メンテナ向け。公開ノートの一部ではありません)

2026-10-01 完了(記録 runs/release/kev-1.0.json、PLAN.md「Released: Kev 1.0」)。手順 3 と 4: カードのみのコミットで、各カードコミットに v1.0 を付けました(0.8B bf75a6a8、4B 6cfce5c2、9B db029f08、27B af0e6d55。その他のファイルはすべて不変)。手順 5 と 6: アセットを 2 回ビルドして同一ハッシュを確認し、リリースを公開して Latest に指定。手順 7: kev-family を残し、そのアセットを削除し、本文を kev-1.0 へのポインタにし、旧ノートを runs/release/kev-family-notes-retired.md に置きました。手順 8: ピンは不変。手順 9: コレクションと Space を確認。Space は再公開していません。リリース前に書かれた計画は以下のとおりです。順序:

  1. プレースホルダ: 記入済み(2026-10-01)、ラウンド 28 の登録済みコンテキスト読み出し runs/r28-readout/context.json(scripts/longdoc_report.py --context-margin -0.03 を runs/r28-{4b-r10,08b-r15}-longdoc、runs/r29-9b-r18a-longdoc、runs/r23-27b-k-w85-longdoc に対して。生データ runs/r28-context、出荷温度での ECE runs/r28-context-served)から。数値は docs/claims.json にあります。

  2. マージ: この PR を。

  3. Hub カード。 各 1.0 カードを README.md としてのみアップロードします(重みなし): カードのみのコミットに kev.publish は不要です。hf upload jaredpalmer/kev-<size> docs/model-cards/kev-<size>.md README.md --commit-message "Kev 1.0 model card (weights unchanged)"。HfApi().model_info(..., files_metadata=True) で adapter_model.safetensors / head.pt(27B: model.safetensors.index.json と全シャード)が下記のとおりにハッシュされることを確認してください。

  4. Hub タグ。 4 リポジトリすべてに v1.0。既定(指定どおり): 正確な重みリビジョン。手順 3 を先に実行した場合は、代わりにカードコミットにタグを付けて、@v1.0 が 1.0 カードを示すようにしてください(重みはバイト単位で同一。両方のコミットを PLAN.md に記録)。

    リポジトリ v1.0 の対象(重み) adapter / head sha256
    jaredpalmer/kev-0.8b 9a45d25eb2ab761841196625383fa1dff0e56c1e 9b908623… / f400bd12…
    jaredpalmer/kev-4b 139fdd94f1b6a6ad80cc15e08fcb99cac885a101 90e81735… / dd633435…
    jaredpalmer/kev-9b b5d8c18e44c60888d138b65cb6507ff0a5a448a0 2b2a70cf… / 8e1dab2c…
    jaredpalmer/kev-27b main(本日 ef78cc8a34d5f426fb229c52089db189218cfe5c: 重み 28be62e9、その後カードのみのコミット 3 つ) 重み d27af6ab… / head 7968f17b…
    hf repos tag create jaredpalmer/kev-0.8b v1.0 --revision 9a45d25eb2ab761841196625383fa1dff0e56c1e -m "Kev 1.0"
    hf repos tag create jaredpalmer/kev-4b   v1.0 --revision 139fdd94f1b6a6ad80cc15e08fcb99cac885a101 -m "Kev 1.0"
    hf repos tag create jaredpalmer/kev-9b   v1.0 --revision b5d8c18e44c60888d138b65cb6507ff0a5a448a0 -m "Kev 1.0"
    hf repos tag create jaredpalmer/kev-27b  v1.0 --revision <main at release> -m "Kev 1.0"
  5. アセット。 uv run python scripts/build_release_assets.py --release docs/releases/kev-1.0-assets.json --out /tmp/kev-1.0-assets が kev-0.8b.tar.gz、kev-4b.tar.gz、kev-9b.tar.gz(それぞれ: 上記リビジョンの Hub スナップショット、つまりアダプタ、温度入りの head.pt、トークナイザファイル、トライアルの result.json、provenance.json、training_config.json、training_metrics.json。1.0 カードを README.md として。ロック済み読みを locked_test.json として)、SHA256SUMS.txt、manifest.json(全メンバーの sha256)をビルドします。アダプタまたは head のハッシュが仕様と異なるダウンロードは拒否します。Kev-27B はアセットではありません(51 GB。GitHub はアセットを 2 GB に制限)。ノートは Hub を指します。

  6. GitHub リリース。 マージコミットに kev-1.0 タグを付けます。これらのノートの公開部分(この節より上すべて)を本文として下書きでリリースを作成し、3 つの tarball と SHA256SUMS.txt を添付し、それらをダウンロードし直し、shasum -a 256 -c SHA256SUMS.txt を実行、1 つを展開して提供し、その後公開して Latest に指定します。

  7. サイズごとに 1 リリース。 リリースポリシーは各サイズの最良版だけを GitHub リリースに残します。kev-1.0 が公開されたら、kev-family はそれを重複させます: 3 つの tarball と SHA256SUMS.txt を削除し、本文を kev-1.0 へのポインタに置き換えます(またはリリースを削除。Jared の判断)。以前のバージョンは各カードに挙げた Hub タグに残ります。

  8. デプロイのピン。 skills/kev-deploy と skills/kev-finetune は KEV_REF 71d4829 を固定しています。1.0 のチェックポイントに新しいコードは不要です。後続の提供修正を 1.0 と一緒に出すべき場合にのみピンを動かしてください。

  9. コレクションと Space。 Kev コレクションはすでに 4 リポジトリを掲載しています。Space は main から Kev-4B と Kev-0.8B を提供しており、それが 1.0 の重みです。最後の公開後に kev/model.py、kev/api.py、kev/checkpoint.py が変わっていなければ、再公開するものはありません。