Kev-0.6B (Qwen3)
Предыдущее поколение (Qwen3). Оставлен как быстрый малый вариант для Apple Silicon (0.12 с на запрос из пяти вопросов против 0.33 с у Kev-0.8B). Для точности используйте Kev-0.8B: на закрытом тесте он набирает 0.668 против 0.642 вне домена у этой модели на тех же элементах. Веса:
jaredpalmer/kev-0.6b.
Kev-0.6B — это модель принятия решений: на входе один документ (состояние) и набор типизированных вопросов, на выходе — распределение вероятностей по каждому вопросу, за один прямой проход. Текст не генерируется. Это LoRA-адаптер (r=16) плюс указательная голова поверх Qwen/Qwen3-0.6B-Base; он реализует публичный контракт TypeSafe /v1/systemone.
Младший представитель семейства Kev. Это лучший чекпойнт на 0.6B по замороженному протоколу оценки с контрольными суммами: данные рецепта 4B/8B (decision-v7) при lr 1e-4, три seed (transfer 0.613 / 0.605 / 0.620), после того как восемь одноручечных мутаций и три seed предыдущих данных не нашли ничего лучше 0.61. Вне домена это модель на 0.6B — для точности используйте Kev-4B; используйте эту там, где память или задержка исключают 4B, и измеряйте на своих данных.
- Hub:
jaredpalmer/kev-0.6b(этот репозиторий; прогонv7-06b/02-trial-2, seed 2 из 3) - Код, наборы, результаты и полный журнал исследований: github.com/jaredpalmer/kev — см.
PLAN.md(полная запись по git-тегуresearch-archive-2026-09-24),runs/leaderboard.mdиevals/v4/*/manifest.json
Что изменилось со времён Kev-0.5B
| Kev-0.5B | Kev-0.6B (этот) | |
|---|---|---|
| бэкбон | Qwen2.5-0.5B | Qwen3-0.6B-Base |
| обучающие записи | 9 000 (шесть источников) | 12 576 (десять публичных источников + 896 минимальных пар политик + 1 680 записей из 60 случайных структур правил) |
| «none of the above» | только исправление аугментации | + минимальные пары: то же состояние, отрендеренное с истинным вариантом и без него |
| точность в распределении (decision-v4 dev) | 0.712 | 0.801 |
| точность вне домена (transfer-v4 dev) | 0.561 | 0.620 |
| вариант «none» присутствует, точность | 0.25 (transfer-v1) | 0.80 |
| seed за числом | 1 | 3 (transfer 0.605–0.620) |
Jev (typesafe-ai/jev через Vercel AI Gateway) на тех же замороженных девелоперских наборах: 0.845 в распределении, 0.857 вне домена. Точность transfer по источникам у этого чекпойнта: QNLI 0.85, SciQ 0.93, TweetEval-offensive 0.69, PAWS 0.59, Emotion 0.49, MMLU 0.50; отложенные структуры политик — около случайного уровня.
Известные ограничения
- Вне домена это модель на 0.6B. Точность transfer держится около ~0.60 при любых гиперпараметрах, что мы пробовали (восемь одноручечных мутаций, три seed). Тот же рецепт на 4B достигает 0.72–0.75, а на 8B — 0.74–0.77; узкое место в этом размере — ёмкость, а не данные.
- Рассуждения о политиках на отложенных данных проваливаются: на программных парах политик, чья структура правил никогда не тренировалась, доля «оба члена пары верны» составляет 6–11% (Kev-4B 0.73, Jev 0.86).
- Порядковое хеджирование: на вопросах Score с тремя уровнями и арифметикой дат модель сваливается на средний уровень.
- Доля уверенных ошибок вне домена — 11% (уверенность ≥0.9 и при этом неверно); сырой ECE 0.09 в распределении, 0.15 вне домена. В распределении вероятности пригодны; вне его относитесь к ним как к справочным.
- Закрытый тест, прочитан один раз (
runs/locked/kev-06b-v7-ungated/): точность в распределении 0.808 (Brier 0.266, ECE 0.089), вне домена 0.642 (Brier 0.483, ECE 0.128, уверенные ошибки 7.9%). Эта партиция больше не будет читаться для этого чекпойнта.
Архитектура
Каузальная LM только на prefill, с блочно-каузальной маской внимания: общий префикс состояния, одна изолированная ветвь на вопрос и указательное считывание по токенам границ вариантов. Вопросы, упакованные в один запрос, получают ровно те же вероятности, что и поодиночке (измеренная максимальная дельта 4e-6). Подробности в README репозитория.
Обучение
Замороженный набор evals/v7/decision-v7 (манифест фиксирует версии датасета и базовой модели): 10 000 публичных записей (1 000 на источник), 896 записей минимальных пар политик по девяти семействам шаблонов и 1 680 записей из 60 случайно сгенерированных структур правил, две эпохи, LoRA r=16 на проекциях внимания и MLP при lr 1e-4, указательная голова с нуля, кросс-энтропия по распределению вариантов, bf16-автокаст с мастер-весами fp32 на одной H100 (~12 мин). Аугментация: перестановка вариантов, вставка «none of the above», дистракторы и минимальные пары с «none» на 25% записей Choice. Выходы Jev для обучения не использовались.
Протокол оценки
Девелоперские партиции выбирают модели; существует закрытая тестовая партиция, которую читают не более одного раза на продвинутого кандидата. Каждое число выше несёт хеш набора, хеши кода и git-коммит в result.json. Сравнения используют парный бутстрэп с кластеризацией по записям. См. PLAN.md по git-тегу research-archive-2026-09-24 («Evidence and corrections») о поправках, которые мы внесли в собственные прежние утверждения.
Использование
from typesafe import TypeSafeClient # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
Запустите с помощью uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008 из репозитория.
Лицензия
Apache-2.0 для адаптера и головы. Базовая модель — Apache-2.0 (Qwen3). Обучающие наборы данных несут собственные лицензии.