Документация

Практическое руководство по модели принятия решений

Эти страницы отвечают на три вопроса:

  • Как их на самом деле используют в реальных проектах?
  • Какие практики повторяются, и какие из них существуют только потому, что кто-то на них обжёгся?
  • Что говорит доказательная база о той части, которую документация не может закрыть — прежде всего, можно ли доверять вероятностям?

Каждая цифра на следующих страницах взята из публично проверяемого первоисточника: независимого пересчёта, предрегистрированного эксперимента или артефакта, который опубликовал сам проект. О том, какой именно это источник, сказано на странице — потому что эти три типа несут очень разный вес.

Основная нить

У Jev и Laya есть свойство, которое одновременно легко понять и легко переоценить: форма вывода гарантирована. Запросите Choice — получите один из вариантов плюс вероятность; запросите Noul — получите число от 0 до 1. Здесь нечего разбирать, поэтому не бывает «модель пустилась в рассуждения, и программа упала».

Но это типобезопасность, а не калиброванная вероятность. Второе — другое утверждение, и сегодня его публично оспаривают:

  • Независимый пересчёт обнаружил, что confidence, возвращаемая для вопросов Score, часто представляет собой просто дробную часть score (121 такой вывод, плотно сгруппированный) — что похоже на артефакт формата передачи, а не на калиброванную вероятность.
  • Публичный эксперимент попросил Jev угадать честную игральную кость 400 раз. Он выбрал одну и ту же грань все 400 раз, при средней заявленной вероятности 82.9%; фактическая доля попаданий составила 19.0%.
  • Независимый тест калибровки на данных вне распределения сообщил знак ошибки: Choice и Score систематически переуверены, Boolean систематически неуверен.

Поэтому каждая страница ниже раз за разом возвращается к одной фразе: относитесь к уверенности как к априорной оценке, которую нужно калибровать, а не как к гарантии. Каждая страница ниже о том, что это означает в конкретных условиях.

Как читать числа

Числа ниже происходят из трёх видов источников, и страницы стараются указать, из какого именно:

Источник Что он означает Как его использовать
Самозаявленный Результат самого автора, в его README или блоге Зацепка, а не вывод
Независимо пересчитанный Третья сторона повторила его или опубликовала то, что можете повторить вы Цитируемо, но всё равно проверьте размер выборки
Предрегистрированный Критерии зафиксированы до запуска, результаты публикуются в любом случае Самый информативный тип

Это различие не педантизм. Одна и та же модель фигурирует и в самозаявленных результатах «превосходит Jev», и в независимом отрицательном — оба верны, и разница в том, кто измерял и сколько.