Dokumentation

KI-Grundlagen

Warum TypeSafe Entscheidungsmodelle mit kalibrierten Wahrscheinlichkeiten trainiert, statt auf generierten Text zu optimieren.

Die meisten KI-Produkte sind um ein Gespräch zwischen einem Modell und einem Menschen herum gebaut. TypeSafe geht von einer anderen Wette aus: Groß angelegte Automatisierung wird von KI-zu-KI- und KI-zu-Software-Interaktionen dominiert werden, deshalb zählt die Maschinenschnittstelle mehr als die Chat-Schnittstelle.

Wir nennen das Machine Native Intelligence:

KI mit softwareartigen Eigenschaften wie Struktur, Zuverlässigkeit, Beobachtbarkeit, Testbarkeit, Geschwindigkeit, Konsistenz und niedrigen Kosten.

Produktion bauen, nicht Gott

TypeSafe versucht nicht, ein Modell zu bauen, das alles kann. Es ist für Produktionssysteme entworfen, in denen Code eine eng umrissene Entscheidung braucht, die er prüfen und auf die er reagieren kann.

Unsere Erwartung ist, dass groß angelegte KI-Automatisierung eher bei 99 % Maschine-zu-Maschine-Interaktionen und 1 % menschlicher Interaktion liegen wird. Das verschiebt das Designziel von Antworten, die sich gut lesen lassen, hin zu Ausgaben, die sich innerhalb von Software vorhersehbar verhalten.

Lies das TypeSafe-Manifest.

Drei Ansätze für das Post-Training

Vortrainierte Sprachmodelle wurden auf zwei wesentliche Arten angepasst. TypeSafe fügt eine dritte hinzu. RLHF und RLVR sind hier zum Kontext gezeigt; TypeSafes Trainingsweg ist RLCD.

RLHF

Reinforcement Learning from Human Feedback machte aus vortrainierten Modellen Chatbots. Es trainiert Modelle darauf, Antworten zu erzeugen, die Menschen bevorzugen.

RLVR

Reinforcement Learning with Verifiable Rewards schuf Reasoning-Modelle, die bei Aufgaben wie Mathematik stark sind, aber langsamer und teurer.

RLCD

Reinforcement Learning for Calibrated Decisions trainiert TypeSafe darauf, Entscheidungen und kalibrierte Wahrscheinlichkeiten statt generierten Text zurückzugeben.

RLHF wurde verwendet, um InstructGPT und ChatGPT zu trainieren, und wurde von Diogo Almeida mitentwickelt, Mitgründer von TypeSafe.

Vortrainierte Sprachmodelle verzweigen sich in gedämpfte RLHF- und RLVR-Pfade und einen hervorgehobenen RLCD-Pfad für Entscheidungsmodelle.

RLCD und kalibrierte Entscheidungen

RLCD optimiert auf einen anderen Ausgabevertrag:

  • Das Modell erzeugt keinen Text.
  • Es gibt Entscheidungen und Wahrscheinlichkeiten zurück.
  • Eine höhere Wahrscheinlichkeit sollte einer größeren Chance entsprechen, dass die Antwort richtig ist.

Kalibrierung macht Unsicherheit für Software nutzbar. Über viele Vorhersagen eines gut kalibrierten Modells hinweg:

  • Ergebnisse, denen eine Wahrscheinlichkeit von 0.2 zugewiesen wird, sollten etwa 20 % der Zeit auftreten.
  • Ergebnisse, denen eine Wahrscheinlichkeit von 0.8 zugewiesen wird, sollten etwa 80 % der Zeit auftreten.
  • Ergebnisse, denen eine Wahrscheinlichkeit von 1.0 zugewiesen wird, sollten 100 % der Zeit auftreten.

Diese Raten beschreiben Gruppen von Vorhersagen, nicht eine Garantie für eine einzelne Antwort. Siehe Konfidenz für Hinweise, wann Software handeln oder eskalieren sollte.

Die Probleme mit RLHF

RLHF bringt einem Modell bei, Dinge zu sagen, die Menschen bevorzugen. Dieses Ziel funktioniert gut für Chatbots, kann aber auch Sycophantie und überzeugend klingende Halluzinationen belohnen.

Preference-Optimierung verursacht außerdem Mode Dropping: Das Modell lernt, einen bestimmten Stil zu bevorzugen, etwa Instruction Following, während es die Wahrscheinlichkeit anderer möglicher Ausgaben verringert.

Die Wahrscheinlichkeitsverteilung eines Basismodells im Vergleich zu einer verengten, mode-dropped Verteilung nach RLHF.

Mode Dropping ist eine mildere Version von Mode Collapse. Im klassischen Fehlermodus eines generativen adversariellen Netzwerks lernt ein Generator, immer wieder dieselbe Art von Ausgabe zu erzeugen, weil diese Ausgabe den Diskriminator weiterhin täuscht.

Analogie zu Mode Collapse
Wiederholte Zeichen veranschaulichen ein GAN, das an Mode Collapse leidet.

RLHF bleibt eine gute Wahl für Konversationsmodelle. TypeSafes Position ist, dass Produktionsautomatisierung ein anderes Trainingsziel braucht — eines, das auf eingeschränkte Entscheidungen und kalibrierte Unsicherheit ausgerichtet ist.