Kev-27B
Сводка по модели
Kev-27B — это модель принятия решений. Она читает один документ (состояние) и набор типизированных вопросов о нём и возвращает калиброванное распределение вероятностей по вариантам, приложенным к каждому вопросу, за один прямой проход и без генерации текста. Она предназначена для разработчиков, которые классифицируют, маршрутизируют, сортируют или проверяют документы до 64k токенов и которым нужны вероятности, пригодные для порогов, — например, чтобы отправлять неуверенные случаи на проверку человеком. Она реализует публичный API System One от TypeSafe (POST /v1/systemone), поэтому TypeSafe SDK работает с ней без изменений. Эта карточка описывает версию 2, выпущенную 2026-09-30: полновесное дообучение Qwen3.8-27B, усреднённое с версией 1.
Детали модели
| Разработчик | Jared Palmer (github.com/jaredpalmer/kev) |
| Тип модели | Модель принятия решений: бэкбон каузальной языковой модели, работающий только на prefill, с указательной головой по вариантам |
| Бэкбон | Qwen/Qwen3.8-27B (ревизия 1d4bf0f2, релиз Qwen после дообучения): 64 слоя, 48 Gated DeltaNet (линейное внимание) и 16 полного внимания, размер скрытого слоя 5 120; каждый вес бэкбона дообучен |
| Голова | Указательная голова: две проекции 5,120 → 256 оценивают закрывающий токен каждого варианта против финального токена вопроса; softmax даёт вероятности |
| Параметры | 25.6B в бэкбоне (башня зрения, LM-голова и слои многотокенного предсказания не загружаются), 2.6M в голове |
| Точность вычислений | bf16 (чекпойнт 51.3 ГБ); обслуживание в bf16 |
| Контекст | Обслуживаются состояния до 65 536 токенов, плюс как минимум 8 192 токена на вопрос. Обучающие состояния были не длиннее 32 768 токенов. |
| Проверенная длина контекста | 65 536 токенов (см. «Длинные документы») |
| Калибровка | Одна температура, T = 1.32, хранится в head.pt и применяется при загрузке |
| Языки | Английский |
| Лицензия | Apache-2.0 (веса и голова); базовая модель — Apache-2.0 |
| Версия | v2 (Kev 1.0), выпущена 2026-09-30 на main из jaredpalmer/kev-27b |
| Предыдущая версия | v1, LoRA-адаптер ранга 16 на той же базе (T = 1.38), на теге v1-lora; её карточка — это README на том теге |
Вход. Состояние (текст либо объект или массив JSON, отрендеренный как размеченный текст) и любое число именованных вопросов, каждый из которых одного из трёх типов:
| Тип | Варианты | Выход |
|---|---|---|
choice |
1–255 именованных вариантов, каждый с необязательным описанием | вероятность на вариант, наиболее вероятный вариант и уверенность |
score |
1–255 упорядоченных уровней | вероятность на уровень и ожидаемый индекс уровня |
noul |
да / нет, с необязательными описаниями | вероятность «да» |
Каждый вопрос отвечается как отдельная строка, продолжающая общее состояние, поэтому вопросы не могут влиять друг на друга; состояние вычисляется один раз и кэшируется.
Назначение
- Типизированные решения по документам: классификация, маршрутизация, сортировка, выбор при извлечении, проверки политик и права на участие, а также оценка предложенного ответа по изложенным критериям.
- Рабочие процессы, которые действуют по уверенности: автоматизировать уверенные случаи и ставить в очередь остальные, с порогами, зафиксированными на размеченной выборке собственной нагрузки пользователя.
- Самостоятельно размещённая замена эндпоинта System One без изменений кода.
Использование вне охвата
- Генерация текста, чат, суммаризация или ответы на открытые вопросы. Модель только оценивает предложенные ей варианты.
- Полностью автоматические решения с юридическими, медицинскими, финансовыми, кадровыми или подобными последствиями для людей, без проверки человеком.
- Вопросы, ответ на которые зависит от фактов, которых нет ни в состоянии, ни в общих знаниях (модель ничего не может посмотреть), и экзамены, требующие больших знаний (см. «Ограничения»).
- Состояния длиннее 65 536 токенов, языки, кроме английского, и аппаратура меньше GPU класса 80 ГБ или Mac с примерно 96 ГБ памяти (см. «Ограничения»).
Как использовать
Запустите её из репозитория Kev на одной GPU B200, H200 или H100 80 ГБ. Веса занимают 51 ГБ, а сервер резидентно около 65.5 ГБ; состояние в 64k токенов дало пик 87.1 ГБ на H200, а состояние в 32k токенов — 78.7 ГБ, поэтому самые длинные состояния требуют больше 80 ГБ.
git clone https://github.com/jaredpalmer/kev.git && cd kev && uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-27b --port 8008 # v2 (this card)
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-27b@v1-lora --port 8008 # v1
На Apple Silicon та же команда обслуживает через MLX (выбирается автоматически), загружая полные веса bf16 как есть, ничего не сливая. Ожидается, что этот путь работает на Mac с 96–128 ГБ, но на этом размере он ещё не запускался (см. «Ограничения»).
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
response = client.system_one(
state="I was charged twice for order 1182. Please refund one of the charges.",
questions={
"team": Choice(instructions="Which team should handle this?",
criteria={"billing": "Charges and refunds", "shipping": "Deliveries", "returns": "Exchanges"}),
"urgent": Noul(instructions="Does this need a reply today?"),
},
)
print(response.choices["team"].choice, response.nouls["urgent"].noul)
Калиброванная температура применяется по умолчанию; KEV_TEMPERATURE=1.0 возвращает сырые вероятности. Сервер использует bf16, слитые ядра DeltaNet и CUDA-графы; KEV_DTYPE=fp32 выбирает точный путь, используемый для оценки.
Обучающие данные
Одна эпоха по закрытому корпусу из 145 840 записей (337 130 вопросов) с состояниями не длиннее 32 768 токенов. Публичен только его манифест (evals/sft-v2-r22/manifest.json в репозитории GitHub).
| Компонент | Записи | Содержание и метки |
|---|---|---|
| Корпус Kev | 78 786 | Обучающий набор Kev-27B v1 (десять публичных наборов данных для классификации, сгенерированные записи политик и правил, кейсы арифметики дат и отсутствующих доказательств, длинные состояния с запрятанными фактами); обучающие сплиты наборов Kev по навыкам (hard-v1), инструментам разработчика (devtools-v1) и потребительским жалобам (documents-v1); 24 публичных набора данных с ограничением в 500 записей каждый; семь сгенерированных семейств (длинные документы, маршрутизация инструментов, поиск, интенты, оценка по рубрикам, воздержание, числовые рассуждения) |
| Лицензированные семейства задач | 24 000 | 119 семейств задач из публичной многоцелевой коллекции, с лицензиями, разрешающими коммерческое использование, и родными метками; список семейств не публикуется |
| Длинные состояния | 3 200 | Состояния из корпуса Kev, встроенные в документы на 8k–32k токенов; метки унаследованы точно |
| Длинные документы | 7 617 | Документы, собранные кодом, метки вычислены кодом |
| Решения вне домена | 7 312 | Сгенерированные решения в разнообразных доменах |
| Тон | 7 544 | Минимальные пары одного и того же текста, написанного спокойно, раздражённо или злобно |
| Prompt-инъекции | 2 699 | Распознавание косвенной prompt-инъекции (защитное) |
| Сессии агентов | 4 875 | Вопросы о сгенерированных кодом журналах сессий агентов |
| PII | 4 152 | Классификация персональных данных, вставленных кодом (все вымышленные) |
| Опора на документ | 5 655 | Подкреплено ли утверждение документом |
Источники и метки. Публичные наборы данных перечислены в метаданных этой карточки; два источника по инструментам разработчика, CodeReviewer и FlakeFlagger, взяты из Zenodo, а диффы CodeReviewer берутся только из проектов с разрешительными лицензиями. Сгенерированный текст и метки происходят из кода или из открытых моделей (GLM-5.3, DeepSeek-V4-Pro, Inkling, Mistral Large 3, gpt-oss-120b, MiMo-V2.6-Pro). Метки потребительских жалоб происходят из открытых моделей, отфильтрованные закрытыми судьями и арбитражем. Ни один выход Jev (хостируемой модели принятия решений от TypeSafe) не использовался.
Лицензии. Четыре из ограниченных публичных наборов данных — share-alike: ARC (CC-BY-SA-4.0), HotpotQA (CC-BY-SA-4.0), Natural Questions (CC-BY-SA-3.0) и SNLI (CC-BY-SA-4.0); остальные — CC-BY-4.0, MIT или Apache-2.0. Повествования о жалобах CFPB — произведения правительства США. Лицензия GLM-5.3 — в стиле MIT с условием для очень крупных операторов model-as-a-service. Лицензии, ревизии и атрибуции по каждому источнику зафиксированы в манифестах компонентов.
Проверка на загрязнение. Перед обучением каждая запись проверялась против 102 оценочных партиций (76 549 референсных элементов): каждый замороженный набор Kev, закрытый оценочный набор, публичные элементы JevBench и наборы только для оценки ниже. Запись удалялась при точном совпадении нормализованных строк, сходстве Jaccard по 8-граммам слов выше 0.2 или вложении не менее 0.5; было удалено 6 388 обучающих записей.
Процедура обучения
- Полновесное дообучение. Одна эпоха от
Qwen/Qwen3.8-27Bна 8 GPU NVIDIA H200 (FSDP2). AdamW (β 0.9 / 0.999, weight decay 0.01) с мастер-весами и моментами fp32 поверх бэкбона bf16; скорость обучения 2e-6 для бэкбона и 1e-4 для головы, расписание one-cycle с 10 % разогрева; норма градиента ограничена на 1.0; 128 записей на шаг оптимизатора (8 на GPU, 2 шага накопления), 1 140 шагов; seed 0. Лосс — кросс-энтропия по вариантам каждого вопроса (мягкие цели там, где они есть в данных). Порядок вариантов перемешивается, варианты «none of the above» и дистракторы вставляются случайно. Четверть записей choice с состояниями не длиннее 8 192 токенов дополнительно даёт минимальную пару: вопрос с вариантом «none of the above», один раз с присутствующим верным вариантом и один раз с удалённым. Каждое состояние прогоняется один раз, а его вопросы ветвятся от него. - Усреднение весов. Каждый тензор бэкбона — это 0.85 × дообученный вес + 0.15 × вес v1 (LoRA-адаптер v1 слит с базой в fp32), вычислено в fp32 и один раз округлено до bf16. Указательная голова дообученной модели сохраняется. Пропорция выбиралась среди шести смесей (0.85 / 0.70 / 0.50, с той или иной головой) на девелоперских данных.
- Калибровка. Одна температура, T = 1.32, минимизирующая отрицательное логарифмическое правдоподобие на 648 вопросах из отложенных наборов данных, на которых не обучался ни один из родителей: 448 из калибровочного сплита transfer-r3 (шесть публичных наборов данных, QNLI, SciQ, TweetEval-offensive, PAWS, MMLU и Emotion, плюс два отложенных семейства сгенерированных записей политик) и 200 вопросов MMLU-Pro (transfer-v9 development). Ни одна партиция обучающего корпуса не использовалась, и проверка не нашла пересечения с обучающими данными.
Оценка
Методология. Каждое сравнение идёт против Kev-27B v1 на идентичных элементах, каждая модель при своей обслуживаемой температуре. Тестовые партиции читались один раз для этого чекпойнта; тест transfer-v4 закрыт (читается один раз на кандидата) и оценивался по заранее зафиксированной планке (точность ≥ 0.886, Brier ≤ 0.165). Интервалы — это 95 % парные бутстрэпы с пересэмплированием целых записей (2 000 пересэмплов), поэтому вопросы, делящие одно состояние, движутся вместе. Различия даны в процентных пунктах (п.п.). Наборы:
- breadth-v1: 14 отложенных публичных наборов данных в пяти областях (знания, язык, поиск, инструменты, искусство), обучение на них не велось.
- tasksource-heldout-v1: 24 целых семейства задач из той же многоцелевой коллекции, что и лицензированный компонент, удержанные от обучения.
- hard-v1: программно размеченные записи навыков (длинные политики, компромиссы, вероятность, многошаговые рассуждения, даты и числа, оценка, воздержание); тестовый сплит удерживает шаблоны тренированных генераторов.
- devtools-v1: решения по инструментам разработчика из публичных источников с проверенной лицензией (код-ревью, сообщения коммитов, безопасность, нестабильные тесты).
- documents-v1 / documents-v2: повествования о потребительских финансовых жалобах США (CFPB); v2 — закрытый отложенный тестовый набор.
- transfer-v4: решения вне домена из шести никогда не обучавшихся публичных источников плюс отложенные структуры политик.
- longdoc-v1: коммерческие контракты CUAD до 64k токенов и сгенерированные пакеты соглашений.
Ключевые панели исключают элементы, которые аудит меток, завершённый до создания этого чекпойнта, признал несостоятельными¹; каждое исключение убирает одни и те же строки у обеих моделей.
Результаты против v1 (тестовые партиции).
| Панель (вопросы) | Kev-27B v2 | Kev-27B v1 | Δ [95 % CI] |
|---|---|---|---|
| Отложенные публичные наборы данных, breadth-v1, 10 наборов (2 489) | 0.832 | 0.820 | +1.2 [+0.3, +2.2] |
| Отложенные семейства задач, tasksource-heldout-v1, 17 семейств (2 024) | 0.795 | 0.743 | +5.3 [+3.7, +6.8] |
| Навыки, инструменты разработчика и документы, объединённо (2 795) | 0.889 | 0.800 | +8.9 [+7.5, +10.3] |
| hard-v1 (1 088) | 0.918 | 0.749 | +16.9 [+14.2, +19.8] |
| devtools-v1, audited-источники (771) | 0.825 | 0.789 | +3.6 [+1.3, +5.9] |
| documents-v1 (936) | 0.908 | 0.869 | +4.0 [+2.1, +5.9] |
| documents-v2, закрытый отложенный (953) | 0.921 | 0.881 | +4.0 [+2.0, +6.1] |
| breadth-v1, все 14 наборов (3 089) | 0.757 | 0.748 | +0.8 [−0.1, +1.8] |
| Вне домена, закрытый тест transfer-v4 (656): точность | 0.8887 | 0.8963 | −0.8 [−2.0, +0.5] |
| Вне домена, закрытый тест transfer-v4: Brier / покрытие при ошибке ≤ 5 % | 0.154 / 0.875 | 0.160 / 0.835 | – |
Сравнение с другими моделями принятия решений на тесте breadth-v1 (все 14 наборов), оценённое по индексу со случайной поправкой из community Decision Index 0.2 (по каждому набору (score − chance) / (1 − chance), усреднённый внутри каждой области, затем 100 × среднее по пяти областям). Jev запрашивался через Vercel AI Gateway, а AutoJev-27B (denis-pplx/autojev-27b, полновесное дообучение той же базы) — через собственный сервер, по одному разу каждый, на тех же элементах.
| Kev-27B v2 | Kev-27B v1 | Jev | AutoJev-27B | |
|---|---|---|---|---|
| Индекс [95 % CI] | 52.3 [49.2, 55.4] | 50.2 [47.0, 53.2] | 54.0 [51.2, 57.0] | 50.0 [47.0, 53.3] |
Против v1 разница индекса составляет +2.1 [−0.4, +4.6]. Парный интервал против Jev не вычислялся.
Длинные документы (контракты CUAD в тесте longdoc-v1, точность / ECE по длине состояния в токенах):
| Длина состояния (вопросы) | Kev-27B v2 | Kev-27B v1 |
|---|---|---|
| меньше 8k (867) | 0.874 / 0.059 | 0.900 / 0.025 |
| 8k–16k (443) | 0.880 / 0.052 | 0.892 / 0.028 |
| 16k–32k (442) | 0.873 / 0.061 | 0.882 / 0.019 |
| 32k–64k (442) | 0.867 / 0.060 | 0.876 / 0.014 |
| все (2 194) | 0.874 / 0.053 | 0.890 / 0.007 |
Разница точности по всем длинам: −1.6 [−3.0, −0.3]. На сгенерированных пакетах соглашений (2 400 вопросов) обе модели набирают 1.000.
Длина контекста. Проверенная длина контекста: 65 536 токенов, лимит обслуживания, из longdoc-v1 development (парная разница точности на CUAD относительно бина 8k, п.п. [95 % CI]: 16k +0.2 [−0.7, +1.2], 32k −0.2 [−1.2, +0.7], 64k −1.1 [−2.4, +0.0]; по 445–447 вопросов каждый). Правило — то же, что применяется к каждому размеру Kev 1.0: проверенная длина — это номинальный размер наибольшего бина от 16 384 токенов и выше, такого что он и каждый бин между ним и 8 192 остаются в допуске, а именно разница точности на CUAD относительно бина 8k, спаренная по одному и тому же контракту, повторам и вопросу, имеет 95 % нижнюю границу не ниже −3 п.п., при том что на каждую запись дан ответ.
Калибровка (expected calibration error, ECE, как обслуживается; меньше — лучше):
| Панель | Kev-27B v2 | Kev-27B v1 |
|---|---|---|
| тест breadth-v1, 10 наборов | 0.015 | 0.013 |
| тест tasksource-heldout-v1 | 0.049 | 0.051 |
| тест hard-v1 + devtools-v1 + documents-v1 | 0.014 | 0.027 |
| закрытый тест transfer-v4 | 0.019 | 0.018 |
| контракты CUAD, тест longdoc-v1 | 0.053 | 0.007 |
На 648 подгоночных вопросах 5-фолдовая кросс-валидация с непересекающимися по группам фолдами снижает ECE с 0.048 (сырой) до 0.038 (вне фолда); два интервала перекрываются. 90 % бутстрэп-интервал температуры — [1.20, 1.45]. На его концах ключевые панели движутся в противоположных направлениях: ECE breadth-v1 растёт до 0.026 при T = 1.20, а ECE tasksource-heldout-v1 — до 0.067 при T = 1.45.
Прочие результаты.
| Набор | Kev-27B v2 | Kev-27B v1 |
|---|---|---|
| development transfer-v4, точность / Brier | 0.851 / 0.218 | 0.848 / 0.229 |
| Короткие состояния, тест transfer-r3 (1 150) | 0.858 | 0.879 |
| тест devtools-v1, все источники (1 071) | 0.790 | 0.711 |
| development decision-v7 (обучающее распределение v1) | 0.865 | 0.866 |
| MMLU-Pro, 10 вариантов (transfer-v9 development) | 0.675 | 0.665 |
| Неотвечаемые элементы, на которые дан ответ с p ≥ 0.9 (меньше — лучше) | 0.00 | 0.00 |
| SemIf (144) / WANLI-v2 (1 002) / TypeSafe (89 отвеченных строк) | 0.965 / 0.756 / 0.854 | 0.972 / 0.745 / 0.865 |
| Отложенные домены тренированных генераторов, точность / ECE: ood-v2 (4 988) | 0.956 / 0.020 | 0.944 / 0.044 |
| agents-ood-v1 (2 084) | 0.988 / 0.032 | 0.967 / 0.137 |
| guardrails-ood-v1 (4 949) | 0.984 / 0.010 | 0.944 / 0.079 |
Тест transfer-r3 — это панель коротких состояний из тех же восьми отложенных источников, что и калибровочный пул; decision-v7 — обучающее распределение v1; transfer-v9 содержит MMLU-Pro и элементы, решающее доказательство которых было удалено. SemIf (написанные вручную решения из проекта SemIf), WANLI-v2 (пары для вывода на естественном языке из тестового сплита WANLI) и TypeSafe (подборка SemIf по рабочим кейсам TypeSafe) приводятся только для сведения: аудит меток счёл их слишком малыми, насыщенными или шумными для ранжирования моделей. WANLI-v2 и TypeSafe были отозваны как оценки 2026-09-30 (около четверти пар WANLI были размечены по-разному двумя аннотаторами, при этом золото выставлено по одной из двух меток; золото TypeSafe — это усреднённый ответ двух закрытых передовых моделей, на слишком малом числе вопросов, чтобы различить чекпойнты); их цифры сохранены как запись.
Паритет обслуживания (H200, bf16 со слитыми ядрами и CUDA-графами, 200 записей development decision-v7 / 280 вопросов):
| Проверка | Результат |
|---|---|
| Обслуживаемый против пути оценки fp32, макс. |Δp| | 0.0223, без изменённых ответов |
| Один вопрос отдельно против полного запроса, макс. |Δp| | 0.0039, без изменённых ответов |
| Обслуживаемый против оценки на состояниях 8k / 32k / 64k токенов, макс. |Δp| | 0.0064 / 0.0095 / 0.0017, без изменённых ответов |
| Время модели на состоянии 64k токенов, новое / кэшированное состояние | 9.4 с / 733 мс |
| Резидентная память / время загрузки из тёплого кэша | 65.5 ГБ / 17.6 с |
| Пропускная способность при 1 / 64 одновременных клиентах | 21.1 / 36.4 запроса/с |
¹ Исключены из ключевых панелей: четыре набора данных breadth-v1 (routerbench, чьим состояниям не хватает запрашиваемой информации; cfcolor и humicroedit, на уровне случайного для любой системы; chessbench, на нижней границе для любой системы); семь семейств tasksource-heldout-v1 с недействительными или невосстановимыми метками (имена закрыты); и две задачи devtools-v1, чьи метки состояние не определяет (flakeflagger, тип изменения коммита). Источник transfer-r3 emotion (метки по далёким ключевым словам) исключён из панели коротких состояний в «Ограничениях».
Ограничения и компромиссы
- Отбор. Выпущенный чекпойнт был выбран после того, как стали известны результаты теста более раннего кандидата, и подтверждён на тех же тестовых наборах. Считайте тестовые запасы оптимистичными.
- Нет прироста на коротких состояниях. На коротких входах она не лучше v1: −0.8 п.п. [−2.0, +0.5] на закрытом тесте transfer-v4, −0.9 п.п. [−2.0, +0.1] на девелоперской панели коротких состояний (development transfer-v4 и тест transfer-r3 без
emotion) и −2.1 п.п. [−3.5, −0.8] на всём тесте transfer-r3. - Хуже и самоувереннее на длинных контрактах. На CUAD она на 1.6 п.п. менее точна, чем v1, а её ECE в 2–4 раза больше, чем у v1, на каждой длине (0.053 против 0.007 в целом). Вопросы CUAD включают несколько неверных или спорных золотых меток, но разрыв устойчив на всех длинах. Для проверки контрактов перенастройте температуру на собственных размеченных документах (
python -m kev.calibrate) или используйте v1. - Приросты в распределении. Обучающие сплиты hard-v1, devtools-v1 и documents-v1 входят в обучающие данные, а наборы ood-v2, agents-ood-v1 и guardrails-ood-v1 — это отложенные домены генераторов, которые тоже производили обучающие данные. Приросты там измеряют отложенные элементы тренированных семейств, а не перенос на новые задачи.
- Неизвестное обучение базы. База — это релиз Qwen после дообучения; её обучающие данные неизвестны, поэтому пересечение между ними и любой оценкой исключить нельзя.
- Знания. Знания задаются базой: MMLU-Pro — 0.675 против 0.840 у Jev на тех же элементах.
- Необученные длины. Состояния в 32k–64k токенов оценивались (longdoc-v1), но на них не обучались.
- Отозванный набор. Набор по тикетам поддержки, использовавшийся для отбора v1 (scienthoon), был отозван как несостоятельный до создания v2, поэтому у v2 нет результата на нём. Не усреднённый дообученный родитель v2 набрал там на 5.5 п.п. [−7.8, −3.2] ниже v1.
- Неопределённость температуры. Интервал температуры ([1.20, 1.45]) сдвигает тестовый ECE вплоть до примерно 0.02.
- Аппаратура. Нужна GPU дата-центра класса 80 ГБ (больше 80 ГБ для самых длинных состояний). Apple Silicon через MLX: полные веса bf16 v2 требуют около 51 ГБ плюс рабочая память, поэтому Mac на 64 ГБ — на грани, а Mac на 96–128 ГБ должен помещать. Это ожидается по измерениям на меньших моделях и ещё не измерено на большом Mac: загрузка полновесного Kev-4B по тому же пути дала пик в размер его весов (8.4 ГБ), а его ответы были в пределах 0.015 от пути оценки fp32 (
runs/mlx-full-4b). v1 (LoRA-адаптер, тегv1-lora) был обслужен через MLX на 128 ГБ M5 Max внешним участником (PR #175): точность 0.849 на development transfer-v4 против опубликованных 0.848, 52 ГБ устойчиво и 97 ГБ в пике, пока адаптер сливался.
Смещения, риски и этические соображения
- Калиброванные вероятности могут создавать неоправданное доверие. Температура была подогнана на публичных отложенных наборах данных и не переносится на любой рабочий процесс; измерьте точность и калибровку на размеченной выборке собственных данных, прежде чем задавать пороги.
- Точность и калибровка сдвигаются при смене домена (например, на длинных контрактах). Следите за частотой ошибок в проде, а не полагайтесь на числа выше.
- Не используйте её для значимых автоматических решений о людях без проверки человеком. Смещения базовой модели и обучающих данных (включая метки, произведённые другими моделями) не измерены.
- Состояния могут содержать личные или конфиденциальные данные. Самостоятельный хостинг держит входные данные на вашей аппаратуре; сервер открыт, если не задан
KEV_API_KEY, поэтому применяйте собственный контроль доступа и политику обращения с данными.
Вычисления
- Дообучение: 8 × NVIDIA H200 в течение 16.2 ч обучающего времени (129 GPU-часов), без учёта перезапусков и оценки.
- Усреднение весов: около 6 минут на CPU.
- Проверки оценки и обслуживания: по одной GPU H200 на Modal.
Происхождение и воспроизводимость
- Код, наборы и отчёты об оценке: github.com/jaredpalmer/kev. Номера релиза:
runs/release/kev-27b-r23.json(scripts/release_numbers.py --release kev-27b-r23). - Дообучение: прогон раунда 22
r22-27b-lr2e6/00-trial-0(experiments/round22/lr2e6.json), sha256 весов3fa0182a…. Смесь: ветвь27b-k-w85раунда 23 (scripts/interpolate_checkpoint.py --toward;interpolation.jsonв репозитории Hub), правило отбора и стадии подтверждения вexperiments/rounds/r23.json; результаты вruns/r23-readout/,runs/r23-verdict/,runs/r23-breadth-report/,runs/serving-27b-r23*/. - Источник смеси: v1 в
jaredpalmer/kev-27b@01b81998(прогонr6-27b-v2/01-trial-1), теперь тегv1-lora. - sha256 выпущенных весов
d27af6ab2be16824166ac639907b4dba40979ff338599c2872721aa6c5072022; sha256head.pt7968f17b03479c1ef9d1c0f3ab8a15e31ecb441cf40691b07ee945ab554d45ad(T = 1.3195). Веса опубликованы в коммите Hub28be62e9. - Проверка: загруженная анонимно с Hub на H200, она воспроизвела логиты предрелизной оценки в точности на 252 из 252 строк SemIf и 764 из 764 строк development transfer-v4 (
runs/release/kev-27b-r23-published.json,runs/release/kev-27b-r23-staging.json).
Цитирование
@misc{palmer2026kev27b,
title = {Kev-27B: a calibrated decision model on Qwen3.8-27B},
author = {Palmer, Jared},
year = {2026},
howpublished = {\url{https://huggingface.co/jaredpalmer/kev-27b}},
note = {Version 2, released 2026-09-30}
}
Контакты
Вопросы и проблемы: github.com/jaredpalmer/kev/issues.