Глоссарий моделей принятия решений
В исходной документации эти термины даны по-английски. Сайт закрепляет единый перевод для каждого и сохраняет английский оригинал рядом.
- System Oneмодель System One
Класс моделей, обученных принимать быстрые структурированные решения, которые программное обеспечение может использовать напрямую. Ключевое отличие от генеративных LLM в том, что они не создают текст — значит, нечего разбирать и нет места для галлюцинаций. На выходе — типизированные значения и распределения вероятностей, по которым ваш код может ветвить, сортировать и маршрутизировать.
- stateсостояние
Материал, который оценивает модель System One: письмо, тикет, документ JSON, фрагмент текста договора. Все вопросы в запросе оцениваются независимо относительно одного и того же состояния. Практическое следствие: добавление вопросов почти не меняет задержку, а больше вопросов не ухудшают контекст.
- questionвопрос (примитив)
Типизированный вопрос, задаваемый состоянию. Их ровно три: choice, score и noul. Их называют примитивами по аналогии с программными примитивами — модульными, компонуемыми, структурированными. Можно смешивать все три и задавать сразу много в одном запросе.
- choicechoice (выбор)
Выберите один вариант из заданного набора. Choice в Jev принимает до 255 вариантов. Помимо выбранного элемента, вы получаете вероятность для каждого варианта и общую уверенность. Подходит для классификации, маршрутизации и выбора одного кандидата из многих.
- scorescore (балл)
Разместите состояние на упорядоченной, описанной шкале. Ответ — это score, вероятность для каждого уровня и уверенность. Отличие от choice в том, что уровни упорядочены. Частая ошибка — задавать один составной вопрос; разделите его на атомарные score и объедините их с весами, которые вы задаёте в коде.
- noulnoul (суждение да/нет)
Задайте вопрос да/нет и получите вероятность того, что ответом будет «да» (0–1). Это не то же самое, что уверенность: noul — это вероятность о мире, а уверенность — то, насколько надёжным модель считает собственное суждение.
- confidenceуверенность (confidence)
Насколько модель уверена в собственном суждении. Это самый полезный результат: ответ говорит, что, а уверенность — стоит ли на него опираться. Типичное применение — gating: автоматически применять выше порога, а ниже передавать человеку. Учтите, что его возвращают не все типы вопросов: choice и score — да; noul — нет, поскольку сам является вероятностью.
- calibrationкалибровка
Означают ли вероятности то, что заявляют: среди выборок, которые модель относит к 70%, действительно около 70% должны быть положительными. Обе модели обучают этому с помощью обучения с подкреплением на строго правильных правилах оценки (Jev называет это RLCD), и это предпосылка для использования уверенности в качестве порога. Некалиброванная уверенность — просто число.
⚠️ Обучение с целью калибровки не то же самое, что выдача калиброванных вероятностей. Есть публичные свидетельства обратного: в независимом эксперименте Jev просили угадать честную кость 400 раз, и она каждый раз выбирала одну и ту же грань при средней заявленной уверенности 82.9% против фактической доли попаданий 19.0%; предрегистрированный тест вне распределения обнаружил противоположные направления смещения для разных примитивов. В продакшене относитесь к уверенности как к априорной величине, которую нужно калибровать, и измерьте доверительную полосу на собственных данных — см. измерения и выбор порога в руководстве.
- escalationэскалация (передача человеку)
Передача решения человеку, когда уверенность попадает в среднюю полосу. Это спроектированный уровень, а не ветка отказа: выше — автоматически применить, ниже — отбросить, полосу между ними — эскалировать. Две вещи легко упустить: полоса — это человеческие затраты (чем шире полоса, тем больше работы для людей), а эскалация нуждается в защите от сбоев — без неё необработанный элемент остаётся там навсегда, а дашборд выглядит точно как «всё в порядке».
fast-jev-compaction6,653★ · foreman540★ →
- cascadeкаскад
Пусть сначала решает дешёвый уровень, а дорогой модели передаётся только то, в чём он не уверен. Экономия равна доле трафика внутри области высокой уверенности — в одном измерении 37% случаев были окончательно решены при ≥90% уверенности, что убрало 37% вызовов большой модели, — а не какому-то фиксированному проценту. Это предполагает, что меньшая модель ошибается как случайный шум; если она систематически самоуверенна на одном классе входных данных, этот класс никогда не эскалируется.
jev-review (devagrawal09)586★ · jev-search446★ →
- fan-out
Задайте много вопросов в одном запросе и позвольте коду оставить полезные ответы. Экономится в основном вход: одно и то же состояние отправляется один раз, поэтому чем больше вопросов, тем тоньше распределяются фиксированные накладные расходы на запрос (в одном измерении: медианная экономия входных токенов 76–86% при 8 вопросах параллельно). ⚠️ Подходит для независимых суждений — классификации, оценивания, фильтрации — и не для ранжирования, где элементы нужно сравнивать друг с другом: бенчмарк показал, что пакетный путь не проходит его порог качества ранжирования.
jev-review (devagrawal09)586★ · jev-search446★ →
- guardrailограничитель (guardrail)
Одно структурированное суждение, применяемое до того, как содержимое попадает в систему или покидает её, которое решает: пропустить / проверить / заблокировать / перенаправить. Ключевой компромисс здесь не порог, а в какую сторону он склоняется при ошибке: ограничители риска (разрешения, секреты, опасные действия) должны быть fail-closed, а ограничители пропускной способности (проверки завершённости, проверки формата) должны быть fail-open. Ещё одна повторяющаяся практика — сначала запускать детерминированные правила и отдавать модели только серую зону, которую правила решить не могут.
fast-jev-compaction6,653★ · foreman540★ →
- abstentionвоздержание
Механизм, которым модель помечает ответы, в которых не уверена, не отбрасывая их. Задайте запросу порог
min_confidence— и любой ответ ниже него вернётся помеченным какlow_confidence; сам ответ по-прежнему возвращается, а что с ним делать, решает вызывающий. Ворота сообщают одно из трёх состояний:passed,abstainedилиunevaluated(ответ не содержал пригодной уверенности, поэтому ворота не смогли решить). Если порог не задан, ни один из ключей не появляется: отсутствие — это и есть отчёт, а не четвёртое состояние.- local deploymentлокальное развёртывание
Практика запуска открытых моделей принятия решений на собственной машине — Ollaya один из готовых способов это сделать. Приметы: веса лежат на локальном диске, сервис слушает loopback-адрес вроде
127.0.0.1:11435, за вызов ничего не берут, а ваши данные остаются внутри вашей среды. Развёртывание и модель — это два слоя: одно развёртывание может обслуживать много моделей, а точность, которую вы получаете, принадлежит модели, а не развёртыванию.