Документация

Kev-27B

Сводка по модели

Kev-27B — это модель принятия решений. Она читает один документ (состояние) и набор типизированных вопросов о нём и возвращает калиброванное распределение вероятностей по вариантам, приложенным к каждому вопросу, за один прямой проход и без генерации текста. Она предназначена для разработчиков, которые классифицируют, маршрутизируют, сортируют или проверяют документы до 64k токенов и которым нужны вероятности, пригодные для порогов, — например, чтобы отправлять неуверенные случаи на проверку человеком. Она реализует публичный API System One от TypeSafe (POST /v1/systemone), поэтому TypeSafe SDK работает с ней без изменений. Эта карточка описывает версию 2, выпущенную 2026-09-30: полновесное дообучение Qwen3.8-27B, усреднённое с версией 1.

Детали модели

Разработчик Jared Palmer (github.com/jaredpalmer/kev)
Тип модели Модель принятия решений: бэкбон каузальной языковой модели, работающий только на prefill, с указательной головой по вариантам
Бэкбон Qwen/Qwen3.8-27B (ревизия 1d4bf0f2, релиз Qwen после дообучения): 64 слоя, 48 Gated DeltaNet (линейное внимание) и 16 полного внимания, размер скрытого слоя 5 120; каждый вес бэкбона дообучен
Голова Указательная голова: две проекции 5,120 → 256 оценивают закрывающий токен каждого варианта против финального токена вопроса; softmax даёт вероятности
Параметры 25.6B в бэкбоне (башня зрения, LM-голова и слои многотокенного предсказания не загружаются), 2.6M в голове
Точность вычислений bf16 (чекпойнт 51.3 ГБ); обслуживание в bf16
Контекст Обслуживаются состояния до 65 536 токенов, плюс как минимум 8 192 токена на вопрос. Обучающие состояния были не длиннее 32 768 токенов.
Проверенная длина контекста 65 536 токенов (см. «Длинные документы»)
Калибровка Одна температура, T = 1.32, хранится в head.pt и применяется при загрузке
Языки Английский
Лицензия Apache-2.0 (веса и голова); базовая модель — Apache-2.0
Версия v2 (Kev 1.0), выпущена 2026-09-30 на main из jaredpalmer/kev-27b
Предыдущая версия v1, LoRA-адаптер ранга 16 на той же базе (T = 1.38), на теге v1-lora; её карточка — это README на том теге

Вход. Состояние (текст либо объект или массив JSON, отрендеренный как размеченный текст) и любое число именованных вопросов, каждый из которых одного из трёх типов:

Тип Варианты Выход
choice 1–255 именованных вариантов, каждый с необязательным описанием вероятность на вариант, наиболее вероятный вариант и уверенность
score 1–255 упорядоченных уровней вероятность на уровень и ожидаемый индекс уровня
noul да / нет, с необязательными описаниями вероятность «да»

Каждый вопрос отвечается как отдельная строка, продолжающая общее состояние, поэтому вопросы не могут влиять друг на друга; состояние вычисляется один раз и кэшируется.

Назначение

  • Типизированные решения по документам: классификация, маршрутизация, сортировка, выбор при извлечении, проверки политик и права на участие, а также оценка предложенного ответа по изложенным критериям.
  • Рабочие процессы, которые действуют по уверенности: автоматизировать уверенные случаи и ставить в очередь остальные, с порогами, зафиксированными на размеченной выборке собственной нагрузки пользователя.
  • Самостоятельно размещённая замена эндпоинта System One без изменений кода.

Использование вне охвата

  • Генерация текста, чат, суммаризация или ответы на открытые вопросы. Модель только оценивает предложенные ей варианты.
  • Полностью автоматические решения с юридическими, медицинскими, финансовыми, кадровыми или подобными последствиями для людей, без проверки человеком.
  • Вопросы, ответ на которые зависит от фактов, которых нет ни в состоянии, ни в общих знаниях (модель ничего не может посмотреть), и экзамены, требующие больших знаний (см. «Ограничения»).
  • Состояния длиннее 65 536 токенов, языки, кроме английского, и аппаратура меньше GPU класса 80 ГБ или Mac с примерно 96 ГБ памяти (см. «Ограничения»).

Как использовать

Запустите её из репозитория Kev на одной GPU B200, H200 или H100 80 ГБ. Веса занимают 51 ГБ, а сервер резидентно около 65.5 ГБ; состояние в 64k токенов дало пик 87.1 ГБ на H200, а состояние в 32k токенов — 78.7 ГБ, поэтому самые длинные состояния требуют больше 80 ГБ.

git clone https://github.com/jaredpalmer/kev.git && cd kev && uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-27b --port 8008          # v2 (this card)
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-27b@v1-lora --port 8008  # v1

На Apple Silicon та же команда обслуживает через MLX (выбирается автоматически), загружая полные веса bf16 как есть, ничего не сливая. Ожидается, что этот путь работает на Mac с 96–128 ГБ, но на этом размере он ещё не запускался (см. «Ограничения»).

from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
response = client.system_one(
    state="I was charged twice for order 1182. Please refund one of the charges.",
    questions={
        "team": Choice(instructions="Which team should handle this?",
                       criteria={"billing": "Charges and refunds", "shipping": "Deliveries", "returns": "Exchanges"}),
        "urgent": Noul(instructions="Does this need a reply today?"),
    },
)
print(response.choices["team"].choice, response.nouls["urgent"].noul)

Калиброванная температура применяется по умолчанию; KEV_TEMPERATURE=1.0 возвращает сырые вероятности. Сервер использует bf16, слитые ядра DeltaNet и CUDA-графы; KEV_DTYPE=fp32 выбирает точный путь, используемый для оценки.

Обучающие данные

Одна эпоха по закрытому корпусу из 145 840 записей (337 130 вопросов) с состояниями не длиннее 32 768 токенов. Публичен только его манифест (evals/sft-v2-r22/manifest.json в репозитории GitHub).

Компонент Записи Содержание и метки
Корпус Kev 78 786 Обучающий набор Kev-27B v1 (десять публичных наборов данных для классификации, сгенерированные записи политик и правил, кейсы арифметики дат и отсутствующих доказательств, длинные состояния с запрятанными фактами); обучающие сплиты наборов Kev по навыкам (hard-v1), инструментам разработчика (devtools-v1) и потребительским жалобам (documents-v1); 24 публичных набора данных с ограничением в 500 записей каждый; семь сгенерированных семейств (длинные документы, маршрутизация инструментов, поиск, интенты, оценка по рубрикам, воздержание, числовые рассуждения)
Лицензированные семейства задач 24 000 119 семейств задач из публичной многоцелевой коллекции, с лицензиями, разрешающими коммерческое использование, и родными метками; список семейств не публикуется
Длинные состояния 3 200 Состояния из корпуса Kev, встроенные в документы на 8k–32k токенов; метки унаследованы точно
Длинные документы 7 617 Документы, собранные кодом, метки вычислены кодом
Решения вне домена 7 312 Сгенерированные решения в разнообразных доменах
Тон 7 544 Минимальные пары одного и того же текста, написанного спокойно, раздражённо или злобно
Prompt-инъекции 2 699 Распознавание косвенной prompt-инъекции (защитное)
Сессии агентов 4 875 Вопросы о сгенерированных кодом журналах сессий агентов
PII 4 152 Классификация персональных данных, вставленных кодом (все вымышленные)
Опора на документ 5 655 Подкреплено ли утверждение документом

Источники и метки. Публичные наборы данных перечислены в метаданных этой карточки; два источника по инструментам разработчика, CodeReviewer и FlakeFlagger, взяты из Zenodo, а диффы CodeReviewer берутся только из проектов с разрешительными лицензиями. Сгенерированный текст и метки происходят из кода или из открытых моделей (GLM-5.3, DeepSeek-V4-Pro, Inkling, Mistral Large 3, gpt-oss-120b, MiMo-V2.6-Pro). Метки потребительских жалоб происходят из открытых моделей, отфильтрованные закрытыми судьями и арбитражем. Ни один выход Jev (хостируемой модели принятия решений от TypeSafe) не использовался.

Лицензии. Четыре из ограниченных публичных наборов данных — share-alike: ARC (CC-BY-SA-4.0), HotpotQA (CC-BY-SA-4.0), Natural Questions (CC-BY-SA-3.0) и SNLI (CC-BY-SA-4.0); остальные — CC-BY-4.0, MIT или Apache-2.0. Повествования о жалобах CFPB — произведения правительства США. Лицензия GLM-5.3 — в стиле MIT с условием для очень крупных операторов model-as-a-service. Лицензии, ревизии и атрибуции по каждому источнику зафиксированы в манифестах компонентов.

Проверка на загрязнение. Перед обучением каждая запись проверялась против 102 оценочных партиций (76 549 референсных элементов): каждый замороженный набор Kev, закрытый оценочный набор, публичные элементы JevBench и наборы только для оценки ниже. Запись удалялась при точном совпадении нормализованных строк, сходстве Jaccard по 8-граммам слов выше 0.2 или вложении не менее 0.5; было удалено 6 388 обучающих записей.

Процедура обучения

  1. Полновесное дообучение. Одна эпоха от Qwen/Qwen3.8-27B на 8 GPU NVIDIA H200 (FSDP2). AdamW (β 0.9 / 0.999, weight decay 0.01) с мастер-весами и моментами fp32 поверх бэкбона bf16; скорость обучения 2e-6 для бэкбона и 1e-4 для головы, расписание one-cycle с 10 % разогрева; норма градиента ограничена на 1.0; 128 записей на шаг оптимизатора (8 на GPU, 2 шага накопления), 1 140 шагов; seed 0. Лосс — кросс-энтропия по вариантам каждого вопроса (мягкие цели там, где они есть в данных). Порядок вариантов перемешивается, варианты «none of the above» и дистракторы вставляются случайно. Четверть записей choice с состояниями не длиннее 8 192 токенов дополнительно даёт минимальную пару: вопрос с вариантом «none of the above», один раз с присутствующим верным вариантом и один раз с удалённым. Каждое состояние прогоняется один раз, а его вопросы ветвятся от него.
  2. Усреднение весов. Каждый тензор бэкбона — это 0.85 × дообученный вес + 0.15 × вес v1 (LoRA-адаптер v1 слит с базой в fp32), вычислено в fp32 и один раз округлено до bf16. Указательная голова дообученной модели сохраняется. Пропорция выбиралась среди шести смесей (0.85 / 0.70 / 0.50, с той или иной головой) на девелоперских данных.
  3. Калибровка. Одна температура, T = 1.32, минимизирующая отрицательное логарифмическое правдоподобие на 648 вопросах из отложенных наборов данных, на которых не обучался ни один из родителей: 448 из калибровочного сплита transfer-r3 (шесть публичных наборов данных, QNLI, SciQ, TweetEval-offensive, PAWS, MMLU и Emotion, плюс два отложенных семейства сгенерированных записей политик) и 200 вопросов MMLU-Pro (transfer-v9 development). Ни одна партиция обучающего корпуса не использовалась, и проверка не нашла пересечения с обучающими данными.

Оценка

Методология. Каждое сравнение идёт против Kev-27B v1 на идентичных элементах, каждая модель при своей обслуживаемой температуре. Тестовые партиции читались один раз для этого чекпойнта; тест transfer-v4 закрыт (читается один раз на кандидата) и оценивался по заранее зафиксированной планке (точность ≥ 0.886, Brier ≤ 0.165). Интервалы — это 95 % парные бутстрэпы с пересэмплированием целых записей (2 000 пересэмплов), поэтому вопросы, делящие одно состояние, движутся вместе. Различия даны в процентных пунктах (п.п.). Наборы:

  • breadth-v1: 14 отложенных публичных наборов данных в пяти областях (знания, язык, поиск, инструменты, искусство), обучение на них не велось.
  • tasksource-heldout-v1: 24 целых семейства задач из той же многоцелевой коллекции, что и лицензированный компонент, удержанные от обучения.
  • hard-v1: программно размеченные записи навыков (длинные политики, компромиссы, вероятность, многошаговые рассуждения, даты и числа, оценка, воздержание); тестовый сплит удерживает шаблоны тренированных генераторов.
  • devtools-v1: решения по инструментам разработчика из публичных источников с проверенной лицензией (код-ревью, сообщения коммитов, безопасность, нестабильные тесты).
  • documents-v1 / documents-v2: повествования о потребительских финансовых жалобах США (CFPB); v2 — закрытый отложенный тестовый набор.
  • transfer-v4: решения вне домена из шести никогда не обучавшихся публичных источников плюс отложенные структуры политик.
  • longdoc-v1: коммерческие контракты CUAD до 64k токенов и сгенерированные пакеты соглашений.

Ключевые панели исключают элементы, которые аудит меток, завершённый до создания этого чекпойнта, признал несостоятельными¹; каждое исключение убирает одни и те же строки у обеих моделей.

Результаты против v1 (тестовые партиции).

Панель (вопросы) Kev-27B v2 Kev-27B v1 Δ [95 % CI]
Отложенные публичные наборы данных, breadth-v1, 10 наборов (2 489) 0.832 0.820 +1.2 [+0.3, +2.2]
Отложенные семейства задач, tasksource-heldout-v1, 17 семейств (2 024) 0.795 0.743 +5.3 [+3.7, +6.8]
Навыки, инструменты разработчика и документы, объединённо (2 795) 0.889 0.800 +8.9 [+7.5, +10.3]
  hard-v1 (1 088) 0.918 0.749 +16.9 [+14.2, +19.8]
  devtools-v1, audited-источники (771) 0.825 0.789 +3.6 [+1.3, +5.9]
  documents-v1 (936) 0.908 0.869 +4.0 [+2.1, +5.9]
documents-v2, закрытый отложенный (953) 0.921 0.881 +4.0 [+2.0, +6.1]
breadth-v1, все 14 наборов (3 089) 0.757 0.748 +0.8 [−0.1, +1.8]
Вне домена, закрытый тест transfer-v4 (656): точность 0.8887 0.8963 −0.8 [−2.0, +0.5]
Вне домена, закрытый тест transfer-v4: Brier / покрытие при ошибке ≤ 5 % 0.154 / 0.875 0.160 / 0.835 –

Сравнение с другими моделями принятия решений на тесте breadth-v1 (все 14 наборов), оценённое по индексу со случайной поправкой из community Decision Index 0.2 (по каждому набору (score − chance) / (1 − chance), усреднённый внутри каждой области, затем 100 × среднее по пяти областям). Jev запрашивался через Vercel AI Gateway, а AutoJev-27B (denis-pplx/autojev-27b, полновесное дообучение той же базы) — через собственный сервер, по одному разу каждый, на тех же элементах.

Kev-27B v2 Kev-27B v1 Jev AutoJev-27B
Индекс [95 % CI] 52.3 [49.2, 55.4] 50.2 [47.0, 53.2] 54.0 [51.2, 57.0] 50.0 [47.0, 53.3]

Против v1 разница индекса составляет +2.1 [−0.4, +4.6]. Парный интервал против Jev не вычислялся.

Длинные документы (контракты CUAD в тесте longdoc-v1, точность / ECE по длине состояния в токенах):

Длина состояния (вопросы) Kev-27B v2 Kev-27B v1
меньше 8k (867) 0.874 / 0.059 0.900 / 0.025
8k–16k (443) 0.880 / 0.052 0.892 / 0.028
16k–32k (442) 0.873 / 0.061 0.882 / 0.019
32k–64k (442) 0.867 / 0.060 0.876 / 0.014
все (2 194) 0.874 / 0.053 0.890 / 0.007

Разница точности по всем длинам: −1.6 [−3.0, −0.3]. На сгенерированных пакетах соглашений (2 400 вопросов) обе модели набирают 1.000.

Длина контекста. Проверенная длина контекста: 65 536 токенов, лимит обслуживания, из longdoc-v1 development (парная разница точности на CUAD относительно бина 8k, п.п. [95 % CI]: 16k +0.2 [−0.7, +1.2], 32k −0.2 [−1.2, +0.7], 64k −1.1 [−2.4, +0.0]; по 445–447 вопросов каждый). Правило — то же, что применяется к каждому размеру Kev 1.0: проверенная длина — это номинальный размер наибольшего бина от 16 384 токенов и выше, такого что он и каждый бин между ним и 8 192 остаются в допуске, а именно разница точности на CUAD относительно бина 8k, спаренная по одному и тому же контракту, повторам и вопросу, имеет 95 % нижнюю границу не ниже −3 п.п., при том что на каждую запись дан ответ.

Калибровка (expected calibration error, ECE, как обслуживается; меньше — лучше):

Панель Kev-27B v2 Kev-27B v1
тест breadth-v1, 10 наборов 0.015 0.013
тест tasksource-heldout-v1 0.049 0.051
тест hard-v1 + devtools-v1 + documents-v1 0.014 0.027
закрытый тест transfer-v4 0.019 0.018
контракты CUAD, тест longdoc-v1 0.053 0.007

На 648 подгоночных вопросах 5-фолдовая кросс-валидация с непересекающимися по группам фолдами снижает ECE с 0.048 (сырой) до 0.038 (вне фолда); два интервала перекрываются. 90 % бутстрэп-интервал температуры — [1.20, 1.45]. На его концах ключевые панели движутся в противоположных направлениях: ECE breadth-v1 растёт до 0.026 при T = 1.20, а ECE tasksource-heldout-v1 — до 0.067 при T = 1.45.

Прочие результаты.

Набор Kev-27B v2 Kev-27B v1
development transfer-v4, точность / Brier 0.851 / 0.218 0.848 / 0.229
Короткие состояния, тест transfer-r3 (1 150) 0.858 0.879
тест devtools-v1, все источники (1 071) 0.790 0.711
development decision-v7 (обучающее распределение v1) 0.865 0.866
MMLU-Pro, 10 вариантов (transfer-v9 development) 0.675 0.665
Неотвечаемые элементы, на которые дан ответ с p ≥ 0.9 (меньше — лучше) 0.00 0.00
SemIf (144) / WANLI-v2 (1 002) / TypeSafe (89 отвеченных строк) 0.965 / 0.756 / 0.854 0.972 / 0.745 / 0.865
Отложенные домены тренированных генераторов, точность / ECE: ood-v2 (4 988) 0.956 / 0.020 0.944 / 0.044
  agents-ood-v1 (2 084) 0.988 / 0.032 0.967 / 0.137
  guardrails-ood-v1 (4 949) 0.984 / 0.010 0.944 / 0.079

Тест transfer-r3 — это панель коротких состояний из тех же восьми отложенных источников, что и калибровочный пул; decision-v7 — обучающее распределение v1; transfer-v9 содержит MMLU-Pro и элементы, решающее доказательство которых было удалено. SemIf (написанные вручную решения из проекта SemIf), WANLI-v2 (пары для вывода на естественном языке из тестового сплита WANLI) и TypeSafe (подборка SemIf по рабочим кейсам TypeSafe) приводятся только для сведения: аудит меток счёл их слишком малыми, насыщенными или шумными для ранжирования моделей. WANLI-v2 и TypeSafe были отозваны как оценки 2026-09-30 (около четверти пар WANLI были размечены по-разному двумя аннотаторами, при этом золото выставлено по одной из двух меток; золото TypeSafe — это усреднённый ответ двух закрытых передовых моделей, на слишком малом числе вопросов, чтобы различить чекпойнты); их цифры сохранены как запись.

Паритет обслуживания (H200, bf16 со слитыми ядрами и CUDA-графами, 200 записей development decision-v7 / 280 вопросов):

Проверка Результат
Обслуживаемый против пути оценки fp32, макс. |Δp| 0.0223, без изменённых ответов
Один вопрос отдельно против полного запроса, макс. |Δp| 0.0039, без изменённых ответов
Обслуживаемый против оценки на состояниях 8k / 32k / 64k токенов, макс. |Δp| 0.0064 / 0.0095 / 0.0017, без изменённых ответов
Время модели на состоянии 64k токенов, новое / кэшированное состояние 9.4 с / 733 мс
Резидентная память / время загрузки из тёплого кэша 65.5 ГБ / 17.6 с
Пропускная способность при 1 / 64 одновременных клиентах 21.1 / 36.4 запроса/с

¹ Исключены из ключевых панелей: четыре набора данных breadth-v1 (routerbench, чьим состояниям не хватает запрашиваемой информации; cfcolor и humicroedit, на уровне случайного для любой системы; chessbench, на нижней границе для любой системы); семь семейств tasksource-heldout-v1 с недействительными или невосстановимыми метками (имена закрыты); и две задачи devtools-v1, чьи метки состояние не определяет (flakeflagger, тип изменения коммита). Источник transfer-r3 emotion (метки по далёким ключевым словам) исключён из панели коротких состояний в «Ограничениях».

Ограничения и компромиссы

  • Отбор. Выпущенный чекпойнт был выбран после того, как стали известны результаты теста более раннего кандидата, и подтверждён на тех же тестовых наборах. Считайте тестовые запасы оптимистичными.
  • Нет прироста на коротких состояниях. На коротких входах она не лучше v1: −0.8 п.п. [−2.0, +0.5] на закрытом тесте transfer-v4, −0.9 п.п. [−2.0, +0.1] на девелоперской панели коротких состояний (development transfer-v4 и тест transfer-r3 без emotion) и −2.1 п.п. [−3.5, −0.8] на всём тесте transfer-r3.
  • Хуже и самоувереннее на длинных контрактах. На CUAD она на 1.6 п.п. менее точна, чем v1, а её ECE в 2–4 раза больше, чем у v1, на каждой длине (0.053 против 0.007 в целом). Вопросы CUAD включают несколько неверных или спорных золотых меток, но разрыв устойчив на всех длинах. Для проверки контрактов перенастройте температуру на собственных размеченных документах (python -m kev.calibrate) или используйте v1.
  • Приросты в распределении. Обучающие сплиты hard-v1, devtools-v1 и documents-v1 входят в обучающие данные, а наборы ood-v2, agents-ood-v1 и guardrails-ood-v1 — это отложенные домены генераторов, которые тоже производили обучающие данные. Приросты там измеряют отложенные элементы тренированных семейств, а не перенос на новые задачи.
  • Неизвестное обучение базы. База — это релиз Qwen после дообучения; её обучающие данные неизвестны, поэтому пересечение между ними и любой оценкой исключить нельзя.
  • Знания. Знания задаются базой: MMLU-Pro — 0.675 против 0.840 у Jev на тех же элементах.
  • Необученные длины. Состояния в 32k–64k токенов оценивались (longdoc-v1), но на них не обучались.
  • Отозванный набор. Набор по тикетам поддержки, использовавшийся для отбора v1 (scienthoon), был отозван как несостоятельный до создания v2, поэтому у v2 нет результата на нём. Не усреднённый дообученный родитель v2 набрал там на 5.5 п.п. [−7.8, −3.2] ниже v1.
  • Неопределённость температуры. Интервал температуры ([1.20, 1.45]) сдвигает тестовый ECE вплоть до примерно 0.02.
  • Аппаратура. Нужна GPU дата-центра класса 80 ГБ (больше 80 ГБ для самых длинных состояний). Apple Silicon через MLX: полные веса bf16 v2 требуют около 51 ГБ плюс рабочая память, поэтому Mac на 64 ГБ — на грани, а Mac на 96–128 ГБ должен помещать. Это ожидается по измерениям на меньших моделях и ещё не измерено на большом Mac: загрузка полновесного Kev-4B по тому же пути дала пик в размер его весов (8.4 ГБ), а его ответы были в пределах 0.015 от пути оценки fp32 (runs/mlx-full-4b). v1 (LoRA-адаптер, тег v1-lora) был обслужен через MLX на 128 ГБ M5 Max внешним участником (PR #175): точность 0.849 на development transfer-v4 против опубликованных 0.848, 52 ГБ устойчиво и 97 ГБ в пике, пока адаптер сливался.

Смещения, риски и этические соображения

  • Калиброванные вероятности могут создавать неоправданное доверие. Температура была подогнана на публичных отложенных наборах данных и не переносится на любой рабочий процесс; измерьте точность и калибровку на размеченной выборке собственных данных, прежде чем задавать пороги.
  • Точность и калибровка сдвигаются при смене домена (например, на длинных контрактах). Следите за частотой ошибок в проде, а не полагайтесь на числа выше.
  • Не используйте её для значимых автоматических решений о людях без проверки человеком. Смещения базовой модели и обучающих данных (включая метки, произведённые другими моделями) не измерены.
  • Состояния могут содержать личные или конфиденциальные данные. Самостоятельный хостинг держит входные данные на вашей аппаратуре; сервер открыт, если не задан KEV_API_KEY, поэтому применяйте собственный контроль доступа и политику обращения с данными.

Вычисления

  • Дообучение: 8 × NVIDIA H200 в течение 16.2 ч обучающего времени (129 GPU-часов), без учёта перезапусков и оценки.
  • Усреднение весов: около 6 минут на CPU.
  • Проверки оценки и обслуживания: по одной GPU H200 на Modal.

Происхождение и воспроизводимость

  • Код, наборы и отчёты об оценке: github.com/jaredpalmer/kev. Номера релиза: runs/release/kev-27b-r23.json (scripts/release_numbers.py --release kev-27b-r23).
  • Дообучение: прогон раунда 22 r22-27b-lr2e6/00-trial-0 (experiments/round22/lr2e6.json), sha256 весов 3fa0182a…. Смесь: ветвь 27b-k-w85 раунда 23 (scripts/interpolate_checkpoint.py --toward; interpolation.json в репозитории Hub), правило отбора и стадии подтверждения в experiments/rounds/r23.json; результаты в runs/r23-readout/, runs/r23-verdict/, runs/r23-breadth-report/, runs/serving-27b-r23*/.
  • Источник смеси: v1 в jaredpalmer/kev-27b@01b81998 (прогон r6-27b-v2/01-trial-1), теперь тег v1-lora.
  • sha256 выпущенных весов d27af6ab2be16824166ac639907b4dba40979ff338599c2872721aa6c5072022; sha256 head.pt 7968f17b03479c1ef9d1c0f3ab8a15e31ecb441cf40691b07ee945ab554d45ad (T = 1.3195). Веса опубликованы в коммите Hub 28be62e9.
  • Проверка: загруженная анонимно с Hub на H200, она воспроизвела логиты предрелизной оценки в точности на 252 из 252 строк SemIf и 764 из 764 строк development transfer-v4 (runs/release/kev-27b-r23-published.json, runs/release/kev-27b-r23-staging.json).

Цитирование

@misc{palmer2026kev27b,
  title        = {Kev-27B: a calibrated decision model on Qwen3.8-27B},
  author       = {Palmer, Jared},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/jaredpalmer/kev-27b}},
  note         = {Version 2, released 2026-09-30}
}

Контакты

Вопросы и проблемы: github.com/jaredpalmer/kev/issues.