Kaskaden und parallele Fragen
Die Motivation hinter beiden Mustern ist einfach: ein Aufruf eines großen Modells ist teuer, und die meisten Anfragen sind einfach. Ein Entscheidungsaufruf kostet ein bis zwei Größenordnungen weniger als eine Generierung, also ist „frage zuerst das billige, eskaliere bei Unsicherheit” die naheliegende Form.
Kaskaden: entscheide nur, wo du sicher bist
Eine direkte Vergleichs-Evaluierung zur Erkennung medizinischer Halluzinationen liefert eine klare Zahl:
Lass das Entscheidungsmodell die 37% der Fälle entscheiden, bei denen es mindestens 90% konfident ist, und es bewahrt die eigene Genauigkeit jedes großen Modells, während es 37% der Aufrufe des großen Modells einspart.
Das ist es wert, zitiert zu werden, weil es sagt, worin die Einsparung einer Kaskade tatsächlich besteht: der Anteil des Verkehrs, der in deine Hochkonfidenz-Region fällt, nicht ein fester Prozentsatz. Engere Konfidenz bedeutet mehr Einsparung — solange diese Konfidenz echt ist, was uns zurück zur Kalibrierung bringt.
Zwei Details sind leicht zu übersehen:
① Nach der Eskalation sollte das große Modell nicht unbegrenzte Freiheit bekommen. Eine Implementierung, die unsichere Zeilen an ein LLM übergibt, zwingt dieses LLM, aus derselben Label-Menge zu wählen. Ohne das wird das „unsicher” des kleinen Modells in eine Ausgabe verwandelt, die deine Pipeline nicht konsumieren kann.
② Sobald eine Wahl getroffen ist, halte sie. Ein Modell-Router behält seine Auswahl für die gesamte Sitzung bei, um die Kontinuität des Prompt-Caches zu bewahren. Jede Runde neu zu wählen ändert das Präfix und wirft den Cache weg — das Geld, das du beim billigeren Aufruf gespart hast, geht durch den Cache wieder raus.
Parallele Fragen: was du einsparst, ist Input
Entscheidungsmodelle erlauben es dir, viele Fragen in eine einzige Anfrage zu legen; die offiziellen Beispiele stellen Dutzende auf einmal.
Ein Benchmark über 2.976 Aufrufe maß, was das bringt:
| Element | Ergebnis |
|---|---|
| 8 Fragen parallel gegenüber einer nach der anderen | 76–86% mediane Einsparung bei Input-Tokens |
| Fester Overhead pro Anfrage | etwa 261 Input-Tokens |
Die Einsparung ist also nicht „das Modell rechnet schneller” — sondern dass derselbe Zustand einmal gesendet wird. Je mehr Fragen, desto dünner verteilt sich dieser feste Overhead. Bei ein oder zwei Fragen liegt der Unterschied zwischen parallel und sequenziell in derselben Größenordnung wie das Rauschen von Lauf zu Lauf und ist keine Architekturänderung wert.
Gegenbeispiel: Batching kann das Ranking brechen
Das ist der kontraintuitivste Befund auf dieser Seite:
Eine DuckDB-Erweiterung batcht standardmäßig 40 Zeilen. Der Benchmark stellte fest, dass der gebatchte Pfad sein Ranking-Qualitäts-Gate verfehlt, während eine Zeile pro Anfrage es besteht.
Der Grund ist rekonstruierbar: 40 Zeilen in eine Anfrage zu packen, bittet das Modell, 40 relative Reihenfolgen auf einmal zu erzeugen, was schwieriger ist als ein paar Kandidaten auf einmal zu vergleichen. Kosten und Treue stehen hier im Konflikt — und die Kostenseite ist sichtbar (die Rechnung), während die Treueseite unsichtbar ist, es sei denn, du hast ein Gate gebaut, um sie zu messen.
Die allgemeine Regel: parallele Fragen eignen sich für unabhängige Fragen (Klassifikation, Scoring, Beurteilung) und nicht für Fragen, die erfordern, dass Elemente miteinander verglichen werden.
Eine weitere Voraussetzung: die Fehler müssen zufällig sein
Kaskaden funktionieren wegen einer impliziten Annahme: Die Fehler des kleinen Modells sind zufälliges Rauschen, also kann das große Modell sie korrigieren.
Unabhängige Kalibrierungstests außerhalb der Verteilung widersprechen dem. Choice und Score
sind systematisch überkonfident; Boolean ist systematisch unterkonfident. Eine
systematische Verzerrung ist kein Rauschen: Sie bringt das kleine Modell dazu, bei einer ganzen
Klasse von Eingaben hohe Konfidenz zu melden, sodass diese Klasse nie eskaliert wird und
jedes Mal falsch beantwortet wird.
Das Risiko ist dann nicht „etwas geringere Genauigkeit”, sondern dass eine ganze Art von Eingabe konsistent fallengelassen wird, unsichtbar auf Aggregatebene. Um sie zu finden, muss man die Genauigkeit nach Teilklasse betrachten, nicht insgesamt.
In einem Satz
Eine Kaskade spart proportional dazu, wie viel Verkehr in ihrer Hochkonfidenz-Region liegt; parallele Fragen sparen durch Amortisierung eines festen Overheads. Beide haben einen Preis — die erste wettet darauf, dass die Fehler des kleineren Modells zufällig sind, die zweite schadet Aufgaben, die Quervergleiche brauchen.