Wie man ein Entscheidungsmodell evaluiert
Diese Seite beantwortet eine praktische Frage: wenn zwei Zahlenreihen einander widersprechen, welcher glaubst du?
Wie eine öffentliche Evaluierung aussieht
Beginne mit denen, die ein Dritter wiederholen kann. Ihr Design ist nützlicher als ihre Zahlen.
Gemischte Optionen, wiederholte Läufe. Eine Evaluierung mit veröffentlichten Antworten und einem Reproduktions-Runner nutzt 108 Fragen mit vier Optionen, ohne Dokumente und ohne Werkzeuge, mit 3 Läufen pro Frage und gemischter Optionsreihenfolge; Raten ist 25%. Sie berichtet das aktuelle öffentliche Modell bei 84.6%, einen Median von 199 ms und $0.0088, gegenüber dem stärksten vergleichbaren Modell bei 98.0%, aber 2.12 s und $1.59.
⚠️ Die Einheit dieser beiden Zahlen wird in der Quelle nicht angegeben (sie sagt per full run) — mach sie nicht zu einem Preis pro Aufruf.
Der Punkt ist nicht, wer gewinnt, sondern dass alle drei Achsen auf dem Tisch liegen — 84.6% bei 199 ms und 98.0% bei 2.12 s sind zwei verschiedene Produkte, nicht eines, das schlechter ist als das andere.
Das Mischen existiert, um eine ganz bestimmte Sache zu testen: Wenn das Modell empfindlich auf die Optionsreihenfolge reagiert, ist es eine instabile Komponente in der Produktion. Diese Evaluierung berichtet diese Achse.
Die Basisrate ist eine Obergrenze. Eine weitere unabhängige Rangliste führt PubMedQA, Banking77 und HelpSteer2 mit 300 Elementen × 5 Läufen pro Frage aus und veröffentlicht jede Wahrscheinlichkeit pro Entscheidung unter CC BY 4.0. Zwei ihrer Befunde sind wichtig:
- Bei PubMedQA teilt das Modell den ersten Platz, während es 1/28 so viel kostet.
- Bei HelpSteer2 schlägt kein Modell die Label-Basisrate.
Der zweite bedeutet: Bei diesem Datensatz ist „wähle immer das häufigste Label” eine starke Baseline, und nichts hat sie übertroffen. In dieser Situation beweist ein erster Platz nichts — du misst die Label-Verteilung, nicht das Modell.
Zähle fehlerhafte Ausgaben als Fehltreffer. Ein Benchmark tut das ausdrücklich. Das klingt pedantisch, bis dir auffällt, dass es entscheidet, ob Scores verschiedener Modelle überhaupt verglichen werden können — ein Modell, dem erlaubt ist, illegale Werte auszugeben, hat eine bedeutungslose Genauigkeit.
Statistischer Vergleich: größer ist nicht besser
Bedeutet 84.6% gegenüber 85.1%, dass eines besser ist?
Nicht unbedingt. Bei n=100 liegt das klar im Rauschen. Ein Test, der hier tatsächlich verwendet wurde, ist McNemar — er vergleicht die Fälle, in denen zwei Modelle bei denselben Elementen uneinig sind, nicht zwei Summen.
Ein Replikat spielte veröffentlichte Antworten auf 256 Urteile nach und erhielt 231 gegen 238, McNemar p = 0.21 — keinen signifikanten Unterschied zum ursprünglichen Modell. „Kein signifikanter Unterschied” ist eine völlig respektable Schlussfolgerung und weit nützlicher, als darauf zu bestehen, dass eines näher dran ist.
Eine strengere Variante ist die Vorregistrierung: Lege die Kriterien fest, dann führe aus. Ein Ranking-Benchmark tat genau das und berichtete „besteht bei 20 Newsgroups, fällt bei vier von sechs Bedingungen bei Amazon ESCI durch”. Ein halb und halb ausgefallenes Ergebnis wie dieses ist glaubwürdiger als ein vollständiges Bestehen — es zeigt, dass die Kriterien tatsächlich Arbeit leisten.
Vier Fallen in selbstberichteten Zahlen
Die meisten echten Projekte führen einen Datensatz aus und berichten eine Zahl. Diese Zahlen haben vier vorhersehbare Fallen:
① Die Form der Frage ändert die Antwort.
Ein umfrageartiges Experiment ergab einen harten Vergleich: ob eine Ja/Nein-Frage als Noul oder
als Choice geschrieben wird, ist wichtiger als der Abstand zwischen Jev und GPT-4.1. Das heißt:
In vielen „A schlägt B”-Schlussfolgerungen ist das, was tatsächlich die Arbeit leistet,
möglicherweise die Formulierung der Frage. Das Primitiv zu ändern erfordert eine Neumessung;
Ergebnisse übertragen sich nicht.
② Ein Lauf, kleine Stichprobe, keine Varianz. Eine selbstberichtete „100% Angriffsabfangrate” kann auf zehn Elementen beruhen. Anderswo im selben Ökosystem berichten reproduzierbare Projekte mit einem Nenner — „0 adversariale Flipps von 50”. Der Nenner ist die Glaubwürdigkeit.
③ Jitter zwischen Aufrufen. Ein Projekt, das das Modell als Rechner verwendet (es wird pro Zeichen gebeten, eine von 13 Optionen zu wählen), liefert absichtlich einen Rerun-Button mit, um den Jitter zwischen zwei Aufrufen mit derselben Eingabe offenzulegen. Jitter ist nicht das Beängstigende; ihn nicht zu kennen ist es — er bedeutet, dass der Schwellenwert, den du gemessen hast, zu einem anderen Zeitpunkt möglicherweise nicht hält.
④ Ein Spezialist, der auf seinem Heimatterrain gewinnt, ist kein allgemeiner Sieg. Ein Spezialist mit 706.048 Parametern (2,8 MB) punktet 99,7% bei seiner eigenen Formular-Ausfüllaufgabe, wo das allgemeine Modell 83,6% erreicht. Die Autoren sagen unumwunden, dass dies „ein Spezialist auf seinem Heimatterrain und kein allgemeiner Sieg” ist. Dieser Satz sollte die Standardlesart jedes „schlägt Jev”-Eintrags sein.
In einem Satz
Der Wert einer Evaluierung liegt in ihrem Nenner, ihrer Varianz und ihren Teilklassen, nicht in ihrer Schlagzeile. Eine 60 mit Stichprobengrößen, einem Optionsreihenfolge-Test und einem negativen Ergebnis schlägt eine 95 ohne all das.