Практическое руководство по модели принятия решений
Эти страницы отвечают на три вопроса:
- Как их на самом деле используют в реальных проектах?
- Какие практики повторяются, и какие из них существуют только потому, что кто-то на них обжёгся?
- Что говорит доказательная база о той части, которую документация не может закрыть — прежде всего, можно ли доверять вероятностям?
Каждая цифра на следующих страницах взята из публично проверяемого первоисточника: независимого пересчёта, предрегистрированного эксперимента или артефакта, который опубликовал сам проект. О том, какой именно это источник, сказано на странице — потому что эти три типа несут очень разный вес.
Основная нить
У Jev и Laya есть свойство, которое одновременно легко понять и легко переоценить:
форма вывода гарантирована. Запросите Choice — получите один из вариантов плюс
вероятность; запросите Noul — получите число от 0 до 1. Здесь нечего разбирать,
поэтому не бывает «модель пустилась в рассуждения, и программа упала».
Но это типобезопасность, а не калиброванная вероятность. Второе — другое утверждение, и сегодня его публично оспаривают:
- Независимый пересчёт обнаружил, что
confidence, возвращаемая для вопросовScore, часто представляет собой просто дробную часть score (121 такой вывод, плотно сгруппированный) — что похоже на артефакт формата передачи, а не на калиброванную вероятность. - Публичный эксперимент попросил Jev угадать честную игральную кость 400 раз. Он выбрал одну и ту же грань все 400 раз, при средней заявленной вероятности 82.9%; фактическая доля попаданий составила 19.0%.
- Независимый тест калибровки на данных вне распределения сообщил знак ошибки:
ChoiceиScoreсистематически переуверены,Booleanсистематически неуверен.
Поэтому каждая страница ниже раз за разом возвращается к одной фразе: относитесь к уверенности как к априорной оценке, которую нужно калибровать, а не как к гарантии. Каждая страница ниже о том, что это означает в конкретных условиях.
Как читать числа
Числа ниже происходят из трёх видов источников, и страницы стараются указать, из какого именно:
| Источник | Что он означает | Как его использовать |
|---|---|---|
| Самозаявленный | Результат самого автора, в его README или блоге | Зацепка, а не вывод |
| Независимо пересчитанный | Третья сторона повторила его или опубликовала то, что можете повторить вы | Цитируемо, но всё равно проверьте размер выборки |
| Предрегистрированный | Критерии зафиксированы до запуска, результаты публикуются в любом случае | Самый информативный тип |
Это различие не педантизм. Одна и та же модель фигурирует и в самозаявленных результатах «превосходит Jev», и в независимом отрицательном — оба верны, и разница в том, кто измерял и сколько.