Öffentliche Kritik und Ergebnisse, die sich nicht reproduziert haben
Die vorherige Seite behandelte, wie man die Kalibrierung behebt. Diese Seite behandelt, warum sie behoben werden muss — sie sammelt die öffentlichen Gegenbeweise, denn sie schaffen es selten auf die Startseite eines Projekts.
Die richtige Art, diese Seite zu lesen, ist nicht „also ist das Modell schlecht”, sondern: das sind bekannte Fehlermodi, und dein System muss sie überleben.
Das Würfelexperiment
Das direkteste. Bitte das Modell, 400-mal einen fairen Würfel zu erraten:
| Element | Ergebnis |
|---|---|
| Welche Seite es wählte | die gleiche Seite alle 400 Male |
| Durchschnittliche selbstberichtete Wahrscheinlichkeit | 82.9% |
| Tatsächliche Trefferquote | 19.0% |
Diese Zahlen sagen zwei Dinge gleichzeitig. Erstens, eine selbstberichtete Wahrscheinlichkeit kann überhaupt keine Information tragen — 82.9% sagte dir nichts Verlässliches über eine Aufgabe mit 19% Trefferquote. Zweitens, das Modell drückt „ich weiß nicht” nicht aus. Bei einem fairen Würfel ist die richtige Antwort „etwa 16.7% pro Seite”, und die Form der Ausgabe — eine bevorzugte Option mit hoher Wahrscheinlichkeit — hat keine Möglichkeit, das zu sagen.
Ein weiteres Ergebnis desselben Autors ist es wert, festgehalten zu werden: Bei einem synthetischen
Prognosedokument wurde ein 30%iges Knappheitsrisiko durch Choice zu 5.3% und durch Noul zu
26.7%. Gleiche Eingabe, gleiche Bedeutung, anderes Primitiv — ein fünffacher Unterschied. Die
Wahl des Primitivs ändert die Antwort, und es gibt härtere Beweise dafür auf der
Evaluierungsseite.
„Jev lässt sich nicht kalibrieren”
Eine weithin verbreitete Kritik argumentiert auf statistischer Ebene, dass die Kalibrierungsbehauptung mit der verfügbaren Evidenz nicht standhält. Eine stark hochgevotete Diskussion formuliert denselben Punkt sorgfältiger:
Die Typsicherheitsgarantie ist real (aus mehreren Richtungen verifiziert), aber hinter der Kalibrierungsbehauptung steht keine veröffentlichte ECE oder Reliabilitätskurve.
Beachte die Präzision: Es wird nicht gesagt, dass die Kalibrierung falsch ist, sondern dass die öffentlichen Beweise, die sie stützen, fehlen. Das sind unterschiedliche Aussagen, und für eine Ingenieursentscheidung führen sie an denselben Ort — du kannst keinen Produktionsschwellenwert auf etwas setzen, für das es keine veröffentlichte Reliabilitätskurve gibt.
Reranking: ein vollständig negatives Ergebnis
Diese Klasse von Ergebnis ist die wertvollste, weil sie konkret, reproduzierbar ist und genau die Implikation „es kann alles” widerlegt.
Eine Reranking-Evaluierung nutzte 33.047 Elemente, 164 echte Anfragen und 9.831 bewertete Paare und kam zu dem Schluss, dass reines Reranking mit dem Entscheidungsmodell gegen Vektor-Retrieval verliert.
Die Größenordnung ist der Punkt: gut dreißigtausend Elemente und über hundert echte Anfragen sind kein Spielzeug-Setting. Und der Anwendungsfall, den sie widerlegt — semantisches Reranking — ist genau der, von dem am wahrscheinlichsten angenommen wird, er ergebe sich gratis aus der Klassifikation.
Eine geteilte Entscheidung
Manche Ergebnisse hängen davon ab, welche Zeile du liest. Ein Vergleich von Scoring gegen Generierung:
Bei japanischem NLI schlug mehrdimensionales Scoring mit lokal angepassten Gewichten das direkte Fragen (0.9076 vs 0.8373). Aber es markierte etwa 25-mal so viele schwierige harmlose Zeilen als Angriffe (37.2% vs 1.5%).
Der Durchschnitt verbesserte sich, während die Falsch-Positiv-Rate einer Klasse um das 25-Fache stieg. Wenn das fälschliche Markieren harmloser Eingaben in deinem System teuer ist, ist diese Verbesserung für dich negativ — obwohl sie positiv aussieht.
Es gibt auch ein vorregistriertes Experiment (Kriterien vor dem Lauf festgelegt, Ergebnisse in jedem Fall veröffentlicht), das über Datensätze hinweg inkonsistente Urteile produzierte — bestanden bei einem, durchgefallen bei einem anderen.
Die Dokumentation des Anbieters gibt es selbst zu
Die offizielle Seite zur „jaggedness des Modells” listet bekannte Fehlermodi der aktuellen öffentlichen Version. Das ist kein Gegenbeweis, aber seine Existenz sagt etwas: „dieses Modell schneidet bei manchen Aufgaben schlecht ab” ist Teil der offiziellen Position, kein Geheimnis.
Diese Seite in Regeln verwandeln
Daraus ergeben sich drei Ingenieursregeln:
- Schließe nie von dem absoluten Wert einer Konfidenz auf andere Aufgaben. „0.9 bedeutet 90% korrekt” ist bei einer Aufgabe wie dem Würfel schlicht falsch.
- Die Wahl des Primitivs ist eine experimentelle Variable, keine Stilentscheidung. Dieselbe
Frage, als
Choiceoder alsNoulgestellt, kann sich um das Fünffache unterscheiden. Miss diesen Unterschied, statt willkürlich eines zu wählen. - Schau auf Teilklassen, nicht auf Summen. Das 25×-Falsch-Positiv-Beispiel ist im Aggregat völlig unsichtbar.
In einem Satz
Nichts davon ist ein Grund, diese Modelle nicht zu benutzen — es ist ein Grund, den Standardeinstellungen nicht zu trauen. Jedes Muster anderswo in diesem Leitfaden (Code besitzt den Schwellenwert, Gating, konforme Abstinenz) ist eine Art, innerhalb der Beschränkungen dieser Seite zu arbeiten.