Как оценивать модель принятия решений
Эта страница отвечает на практический вопрос: когда два набора чисел расходятся, какому верить?
Как выглядит публичная оценка
Начните с тех, которые третья сторона может повторить. Их дизайн полезнее их чисел.
Перемешанные варианты, повторные запуски. Оценка с опубликованными ответами и скриптом воспроизведения использует 108 вопросов с четырьмя вариантами, без документов и без инструментов, с 3 запусками на вопрос и перемешанным порядком вариантов; случайное угадывание — 25%. Она сообщает о текущей публичной модели на 84.6%, медиане 199 мс и $0.0088 против сильнейшей сопоставимой модели на 98.0%, но 2.12 с и $1.59.
⚠️ Единица измерения у этих двух чисел не указана в источнике (там сказано per full run) — не превращайте их в цену за вызов.
Суть не в том, кто победил, а в том, что все три оси на столе — 84.6% за 199 мс и 98.0% за 2.12 с это два разных продукта, а не один хуже другого.
Перемешивание существует, чтобы проверить одну конкретную вещь: если модель чувствительна к порядку вариантов, она — нестабильный компонент в продакшене. Эта оценка сообщает эту ось.
Базовая доля — это потолок. Другой независимый лидерборд прогоняет PubMedQA, Banking77 и HelpSteer2 по 300 элементов × 5 запусков на вопрос и публикует каждую вероятность на решение под CC BY 4.0. Две его находки важны:
- На PubMedQA модель делит первое место, стоя в 28 раз дешевле.
- На HelpSteer2 ни одна модель не превосходит базовую долю меток.
Второе означает: на этом наборе «всегда выбирай самую частую метку» — сильный бейзлайн, и ничто его не превзошло. В такой ситуации первое место ничего не доказывает — вы измеряете распределение меток, а не модель.
Считайте некорректный вывод промахом. Один бенчмарк явно так и делает. Это звучит педантично, пока не заметишь, что от этого зависит, можно ли вообще сравнивать оценки разных моделей — модель, которой позволено выдавать недопустимые значения, имеет бессмысленную точность.
Статистическое сравнение: больше не значит лучше
Означает ли 84.6% против 85.1%, что одна лучше?
Не обязательно. При n=100 это вполне внутри шума. Один тест, который здесь реально использовали, — McNemar: он сравнивает случаи, где две модели расходятся на одних и тех же элементах, а не два итога.
Одна реплика воспроизвела опубликованные ответы на 256 суждениях и получила 231 против 238, McNemar p = 0.21 — никакого значимого различия с исходной моделью. «Никакого значимого различия» — совершенно достойный вывод, и куда полезнее, чем настаивать, что одна ближе.
Более строгий вариант — предрегистрация: зафиксируйте критерии, потом запускайте. Один рейтинговый бенчмарк сделал именно так и сообщил «проходит на 20 Newsgroups, проваливается по четырём из шести условий на Amazon ESCI». Результат наполовину наполовину вроде этого правдоподобнее сплошного прохождения — он показывает, что критерии действительно работают.
Четыре ловушки в самозаявленных числах
Большинство реальных проектов прогоняют один набор данных и сообщают число. У этих чисел есть четыре предсказуемые ловушки:
① Форма вопроса меняет ответ.
Один эксперимент в стиле опроса дал жёсткое сравнение: то, записан ли вопрос да/нет
как Noul или как Choice, важнее, чем разрыв между Jev и GPT-4.1.
Смысл: во многих выводах «A побеждает B» реально работающую роль может играть
формулировка вопроса. Смена примитива требует нового измерения; результаты не
переносятся.
② Один запуск, маленькая выборка, без дисперсии. Самозаявленная «100% перехвата атак» может опираться на десять элементов. В другом месте той же экосистемы воспроизводимые проекты сообщают со знаменателем — «0 состязательных подмен из 50». Знаменатель и есть правдоподобность.
③ Дрожание между вызовами. Проект, использующий модель как калькулятор (прося её по каждому символу выбрать один из 13 вариантов), намеренно поставляет кнопку перезапуска, чтобы выставить напоказ дрожание между двумя вызовами на одном и том же входе. Дрожание — не страшная часть; страшно не знать о нём — это значит, что порог, который вы измерили, может не удержаться в другой момент.
④ Специалист, побеждающий на своём поле, — не универсальная победа. Специалист на 706,048 параметров (2.8 МБ) набирает 99.7% на своей задаче заполнения форм, где общая модель получает 83.6%. Авторы прямо говорят, что это «специалист на своём поле, а не универсальная победа». Эта фраза должна быть чтением по умолчанию для любой записи «побеждает Jev».
В одном предложении
Ценность оценки — в её знаменателе, дисперсии и подклассах, а не в её заголовке. 60 с размерами выборки, тестом порядка вариантов и отрицательным результатом побеждает 95 без них.