Praxisleitfaden für Entscheidungsmodelle
Diese Seiten beantworten drei Fragen:
- Wie verwendet man es tatsächlich in echten Projekten?
- Welche Praktiken tauchen immer wieder auf, und welche davon existieren nur, weil sich jemand die Finger verbrannt hat?
- Was sagt die Evidenz über den Teil, den die Dokumentation nicht klären kann — vor allem, ob man den Wahrscheinlichkeiten trauen kann?
Jede Zahl auf den folgenden Seiten stammt aus einer öffentlich überprüfbaren Aufzeichnung aus erster Hand: einer unabhängigen Nachrechnung, einem vorregistrierten Experiment oder einem Artefakt, das das Projekt selbst veröffentlicht hat. Um welche es sich handelt, wird auf der Seite gesagt — denn diese drei haben ein sehr unterschiedliches Gewicht.
Der rote Faden
Jev und Laya haben eine Eigenschaft, die sowohl leicht zu verstehen als auch leicht zu
überverkaufen ist: die Form der Ausgabe ist garantiert. Fragst du nach einem Choice,
bekommst du eine der Optionen plus eine Wahrscheinlichkeit zurück; fragst du nach einem Noul,
bekommst du eine Zahl zwischen 0 und 1. Es gibt keinen Text zu parsen, also gibt es auch kein
„das Modell hat herumgeschwafelt und das Programm ist umgefallen”.
Aber das ist Typsicherheit, nicht kalibrierte Wahrscheinlichkeit. Letzteres ist eine andere Behauptung, und sie wird derzeit öffentlich bestritten:
- Eine unabhängige Nachrechnung ergab, dass die für
Score-Fragen zurückgegebeneconfidencehäufig nur der Nachkommateil des score ist (121 solche Ausgaben, dicht geclustert) — was eher nach einem Artefakt des Übertragungsformats aussieht als nach einer kalibrierten Wahrscheinlichkeit. - Ein öffentliches Experiment bat Jev, 400-mal einen fairen Würfel zu erraten. Es wählte alle 400 Male dieselbe Seite, bei einer durchschnittlichen selbstberichteten Wahrscheinlichkeit von 82,9 %; die tatsächliche Trefferquote lag bei 19,0 %.
- Ein unabhängiger Kalibrierungstest außerhalb der Verteilung berichtete das Vorzeichen des
Fehlers:
ChoiceundScoresind systematisch überkonfident,Booleansystematisch unterkonfident.
Also kommt jede Seite unten immer wieder auf einen Satz zurück: Behandle Konfidenz als einen Prior, den du kalibrieren musst, nicht als Garantie. Jede Seite unten handelt davon, was das in einem konkreten Umfeld bedeutet.
Wie man die Zahlen liest
Die folgenden Zahlen stammen aus drei Arten von Quellen, und die Seiten versuchen zu sagen, aus welcher:
| Quelle | Was sie bedeutet | Wie man sie verwendet |
|---|---|---|
| Selbstberichtet | Das eigene Ergebnis des Autors, in seiner README oder seinem Blog | Ein Hinweis, keine Schlussfolgerung |
| Unabhängig nachgerechnet | Ein Dritter hat es wiederholt oder etwas veröffentlicht, das du wiederholen kannst | Zitierfähig, aber prüfe trotzdem die Stichprobengröße |
| Vorregistriert | Kriterien vor dem Lauf festgelegt, Ergebnisse in jedem Fall veröffentlicht | Die aussagekräftigste Art |
Die Unterscheidung ist keine Pedanterie. Dasselbe Modell taucht sowohl in selbstberichteten „schlägt Jev”-Ergebnissen als auch in einem unabhängigen negativen auf — beides ist wahr, und der Unterschied ist, wer gemessen hat und wie viel.