Глоссарий моделей принятия решений

В исходной документации эти термины даны по-английски. Сайт закрепляет единый перевод для каждого и сохраняет английский оригинал рядом.

System Oneмодель System One

Класс моделей, обученных принимать быстрые структурированные решения, которые программное обеспечение может использовать напрямую. Ключевое отличие от генеративных LLM в том, что они не создают текст — значит, нечего разбирать и нет места для галлюцинаций. На выходе — типизированные значения и распределения вероятностей, по которым ваш код может ветвить, сортировать и маршрутизировать.

See also state · question

Источник System One

stateсостояние

Материал, который оценивает модель System One: письмо, тикет, документ JSON, фрагмент текста договора. Все вопросы в запросе оцениваются независимо относительно одного и того же состояния. Практическое следствие: добавление вопросов почти не меняет задержку, а больше вопросов не ухудшают контекст.

See also question · choice

Источник Состояние

questionвопрос (примитив)

Типизированный вопрос, задаваемый состоянию. Их ровно три: choice, score и noul. Их называют примитивами по аналогии с программными примитивами — модульными, компонуемыми, структурированными. Можно смешивать все три и задавать сразу много в одном запросе.

See also choice · score · noul

Источник Примитивы (вопросы)

choicechoice (выбор)

Выберите один вариант из заданного набора. Choice в Jev принимает до 255 вариантов. Помимо выбранного элемента, вы получаете вероятность для каждого варианта и общую уверенность. Подходит для классификации, маршрутизации и выбора одного кандидата из многих.

See also score · noul · confidence

Источник Choice

scorescore (балл)

Разместите состояние на упорядоченной, описанной шкале. Ответ — это score, вероятность для каждого уровня и уверенность. Отличие от choice в том, что уровни упорядочены. Частая ошибка — задавать один составной вопрос; разделите его на атомарные score и объедините их с весами, которые вы задаёте в коде.

See also choice · noul · confidence

Источник Score

noulnoul (суждение да/нет)

Задайте вопрос да/нет и получите вероятность того, что ответом будет «да» (0–1). Это не то же самое, что уверенность: noul — это вероятность о мире, а уверенность — то, насколько надёжным модель считает собственное суждение.

See also confidence · choice

Источник Noul

confidenceуверенность (confidence)

Насколько модель уверена в собственном суждении. Это самый полезный результат: ответ говорит, что, а уверенность — стоит ли на него опираться. Типичное применение — gating: автоматически применять выше порога, а ниже передавать человеку. Учтите, что его возвращают не все типы вопросов: choice и score — да; noul — нет, поскольку сам является вероятностью.

See also noul · score

Источник Уверенность

calibrationкалибровка

Означают ли вероятности то, что заявляют: среди выборок, которые модель относит к 70%, действительно около 70% должны быть положительными. Обе модели обучают этому с помощью обучения с подкреплением на строго правильных правилах оценки (Jev называет это RLCD), и это предпосылка для использования уверенности в качестве порога. Некалиброванная уверенность — просто число.

⚠️ Обучение с целью калибровки не то же самое, что выдача калиброванных вероятностей. Есть публичные свидетельства обратного: в независимом эксперименте Jev просили угадать честную кость 400 раз, и она каждый раз выбирала одну и ту же грань при средней заявленной уверенности 82.9% против фактической доли попаданий 19.0%; предрегистрированный тест вне распределения обнаружил противоположные направления смещения для разных примитивов. В продакшене относитесь к уверенности как к априорной величине, которую нужно калибровать, и измерьте доверительную полосу на собственных данных — см. измерения и выбор порога в руководстве.

Проекты SemIf4,162★ · NanoJev2,159★ →

See also confidence · noul

Источник Уверенность

escalationэскалация (передача человеку)

Передача решения человеку, когда уверенность попадает в среднюю полосу. Это спроектированный уровень, а не ветка отказа: выше — автоматически применить, ниже — отбросить, полосу между ними — эскалировать. Две вещи легко упустить: полоса — это человеческие затраты (чем шире полоса, тем больше работы для людей), а эскалация нуждается в защите от сбоев — без неё необработанный элемент остаётся там навсегда, а дашборд выглядит точно как «всё в порядке».

Проекты fast-jev-compaction6,653★ · foreman540★ →

See also confidence · calibration

Источник Маршрутизация с gating по уверенности

cascadeкаскад

Пусть сначала решает дешёвый уровень, а дорогой модели передаётся только то, в чём он не уверен. Экономия равна доле трафика внутри области высокой уверенности — в одном измерении 37% случаев были окончательно решены при ≥90% уверенности, что убрало 37% вызовов большой модели, — а не какому-то фиксированному проценту. Это предполагает, что меньшая модель ошибается как случайный шум; если она систематически самоуверенна на одном классе входных данных, этот класс никогда не эскалируется.

Проекты jev-review (devagrawal09)586★ · jev-search446★ →

See also escalation · fan-out

Источник Каскад SDE

fan-out

Задайте много вопросов в одном запросе и позвольте коду оставить полезные ответы. Экономится в основном вход: одно и то же состояние отправляется один раз, поэтому чем больше вопросов, тем тоньше распределяются фиксированные накладные расходы на запрос (в одном измерении: медианная экономия входных токенов 76–86% при 8 вопросах параллельно). ⚠️ Подходит для независимых суждений — классификации, оценивания, фильтрации — и не для ранжирования, где элементы нужно сравнивать друг с другом: бенчмарк показал, что пакетный путь не проходит его порог качества ранжирования.

Проекты jev-review (devagrawal09)586★ · jev-search446★ →

See also cascade · question

Источник Спекулятивный fan-out

guardrailограничитель (guardrail)

Одно структурированное суждение, применяемое до того, как содержимое попадает в систему или покидает её, которое решает: пропустить / проверить / заблокировать / перенаправить. Ключевой компромисс здесь не порог, а в какую сторону он склоняется при ошибке: ограничители риска (разрешения, секреты, опасные действия) должны быть fail-closed, а ограничители пропускной способности (проверки завершённости, проверки формата) должны быть fail-open. Ещё одна повторяющаяся практика — сначала запускать детерминированные правила и отдавать модели только серую зону, которую правила решить не могут.

Проекты fast-jev-compaction6,653★ · foreman540★ →

See also escalation · noul

Источник Ограничители для LLM

abstentionвоздержание

Механизм, которым модель помечает ответы, в которых не уверена, не отбрасывая их. Задайте запросу порог min_confidence — и любой ответ ниже него вернётся помеченным как low_confidence; сам ответ по-прежнему возвращается, а что с ним делать, решает вызывающий. Ворота сообщают одно из трёх состояний: passed, abstained или unevaluated (ответ не содержал пригодной уверенности, поэтому ворота не смогли решить). Если порог не задан, ни один из ключей не появляется: отсутствие — это и есть отчёт, а не четвёртое состояние.

See also confidence · calibration · guardrail

Источник HTTP API

local deploymentлокальное развёртывание

Практика запуска открытых моделей принятия решений на собственной машине — Ollaya один из готовых способов это сделать. Приметы: веса лежат на локальном диске, сервис слушает loopback-адрес вроде 127.0.0.1:11435, за вызов ничего не берут, а ваши данные остаются внутри вашей среды. Развёртывание и модель — это два слоя: одно развёртывание может обслуживать много моделей, а точность, которую вы получаете, принадлежит модели, а не развёртыванию.

See also System One

Источник Ollaya · Quickstart