Kev-8B (Qwen3)
Предыдущее поколение (Qwen3). Этот чекпойнт оставлен как быстрый вариант для Apple Silicon (её бэкбон, работающий только на внимании, прогоняет упакованный прямой проход на полной скорости на MPS). Для точности и калибровки используйте Kev-9B: на закрытом тесте он набирает 0.837 против 0.780 вне домена у этой модели на тех же элементах. Веса:
jaredpalmer/kev-8b.
Kev-8B — это модель принятия решений: на входе один документ (состояние) и набор типизированных вопросов, на выходе — распределение вероятностей по каждому вопросу, за один прямой проход. Текст не генерируется. Это LoRA-адаптер (r=16) плюс указательная голова поверх Qwen/Qwen3-8B-Base (ревизия 49e3418f); он реализует публичный контракт TypeSafe /v1/systemone.
Самый точный Kev. Лучший чекпойнт любого размера по замороженному протоколу с контрольными суммами: лучшая точность в распределении, лучшая точность вне домена (0.796 на transfer-v4 dev, шесть пунктов от Jev), лучшие рассуждения о правилах на отложенных данных среди всех Kev на 8B. Тот же рецепт на двух seed: 0.796 / 0.774; этот чекпойнт — seed, выбранный по девелоперской партиции.
- Hub:
jaredpalmer/kev-8b(этот репозиторий; прогонv7-final/00-trial-0) - Код, наборы, каждый прогон с хешами и парными бутстрэпами: github.com/jaredpalmer/kev —
PLAN.md(полная запись по git-тегуresearch-archive-2026-09-24),runs/leaderboard.md
Результаты (одни и те же замороженные элементы для каждой строки)
| | Kev-0.5B (прототип) | Kev-0.6B | Kev-4B | Kev-8B | Jev | |—|—|—|—|—| | точность в распределении (decision-v4 dev, 1 200 вопр.) | 0.712 | 0.801 | 0.854 | 0.863 | 0.845 | | точность вне домена (transfer-v4 dev, 560 вопр.) | 0.561 | 0.620 | 0.790 | 0.796 | 0.857 | | Brier вне домена | 0.50 | 0.536 | 0.328 | 0.337 | 0.211 | | уверенные ошибки вне домена (p ≥ 0.9 и неверно) | – | 10.8% | 8.2% | 9.9% | 3.7% | | отложенные структуры политик, оба члена пары верны | – | 0.08 | 0.73 | 0.69 | 0.86 | | доля смен ответа при перестановке вариантов | 0.21 | 0.02 | 0.00 | 0.00 | 0.00 |
Точность вне домена по источникам (Kev-8B / Jev): QNLI 0.91 / 0.93, SciQ 1.00 / 0.99, TweetEval-offensive 0.79 / 0.81, PAWS 0.78 / 0.79, MMLU 0.70 / 0.90, Emotion 0.56 / 0.59, deadline (арифметика дат с тремя уровнями) 0.60 / 0.93, (A and B) or not C 0.91 / 0.97, if A then not B else C 0.59 / 0.78.
Seed: два seed на decision-v7: transfer 0.796 / 0.774, отложенные пары правил 0.69 / 0.64 (Jev 0.86); этот чекпойнт — seed 0. Обучен на decision-v7 (10k публичных записей + 896 записей политик по девяти семействам шаблонов, включая четыре семейства порядковых порогов Score + 1 680 записей из 60 случайных структур правил с отрицанием в любом месте); элементы development/test побайтово идентичны v4, поэтому каждое число здесь сравнимо с более ранними чекпойнтами.
Закрытый тест, прочитан один раз (runs/locked/kev-8b-v7-preview-ungated/): в распределении 0.870 (Brier 0.193), вне домена 0.780 (Brier 0.327, уверенные ошибки 7.6%, отложенные пары 0.62). Эта партиция больше не будет читаться для этого чекпойнта.
Что мы узнали, строя его
- Вне домена решает ёмкость. При равном бюджете публичных примеров и синтетики 0.6B → 4B даёт +14–19 п.п.; 4B → 8B — +1–7 п.п.
- Дообучение разъедает способности базовой модели, и скорость обучения это контролирует. Базовая 4B в режиме zero-shot с буквенным считыванием набирает 0.688 на тех же элементах MMLU и 0.787 на PAWS; дефолтный рецепт (lr 2e-4) дообучился до 0.60–0.66 / 0.56–0.71. Снижение lr до 5e-5 возвращает большую часть, и это самое крупное улучшение рецепта из найденных нами; меньше целевых модулей LoRA и меньшие ранги помогают слабее.
- Больше публичных обучающих данных повышает точность в распределении и понижает transfer на 4B (10k против 3.4k записей: −3 п.п.). Источники знаний с MCQ (ARC, OpenBookQA, CommonsenseQA) поднимают точность в распределении до 0.86, не сдвигая transfer.
- Программные контрастивные пары политик обучают тренированным структурам правил (оба верны 0.85–1.0), но переносятся на невиданные структуры лишь частично (0.5–0.6 на 4B, 0.03–0.11 на 0.6B).
Известные ограничения
- Рассуждения о политиках на отложенных данных (невиданные композиции правил, арифметика дат с льготными периодами) далеки от Jev.
- Вопросы «продуктовой» формы без обучающего аналога не гарантированы; измеряйте на своих входных данных.
- Вероятности вне домена пригодны, но не калиброваны (сырой ECE 0.128); температура, подогнанная в распределении, не переносится.
- 8B в fp32 требует ~33 ГБ и не помещается на 32 ГБ Mac;
KEV_DTYPE=bf16(~17 ГБ) помещается. Обучение заняло ~70 мин на одной H100.
Обучение
Замороженный набор evals/v6/decision-v6 (байты development/test идентичны v4): 13 000 публичных записей (1 000 на источник: десять источников v4 плюс ARC-Challenge, OpenBookQA, CommonsenseQA) плюс две программные ветви политик по 448 записей, две эпохи, LoRA r=16 на проекциях внимания и MLP, указательная голова с нуля, кросс-энтропия по распределению вариантов, lr 5e-5 (OneCycle), эффективный батч 8, bf16-автокаст с мастер-весами fp32, gradient checkpointing, одна H100 (~70 мин). Аугментация: перестановка вариантов, вставка «none of the above», дистракторы, минимальные пары с «none» на 25% записей Choice. Выходы Jev для обучения не использовались.
Протокол оценки
Девелоперские партиции выбирают модели; закрытую тестовую партицию читают не более одного раза на кандидата. Каждое число несёт хеш набора, хеши кода и git-коммит в result.json. См. PLAN.md по git-тегу research-archive-2026-09-24 («Evidence and corrections») о поправках, которые мы внесли в собственные прежние утверждения.
Использование
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-8b --port 8008 # KEV_DTYPE=bf16 on a 32 GB Mac
Подойдёт любой совместимый с TypeSafe клиент: TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest").
Лицензия
Apache-2.0 для адаптера и головы; база Qwen3 — Apache-2.0; наборы данных несут собственные лицензии.