Glossar der Entscheidungsmodelle

In der Originaldokumentation sind diese Begriffe englisch. Diese Seite legt je eine Übersetzung fest und behält das englische Original daneben.

System OneSystem One-Modell

Eine Klasse von Modellen, die darauf trainiert sind, schnelle, strukturierte Entscheidungen zu treffen, die Software direkt verwerten kann. Der entscheidende Unterschied zu generativen LLMs ist, dass sie keinen Text erzeugen — es gibt also nichts zu parsen und nichts zu halluzinieren. Die Ausgabe sind typisierte Werte und Wahrscheinlichkeitsverteilungen, auf die dein Code verzweigen, sortieren und routen kann.

See also state · question

Original System One

stateZustand

Das Material, das ein System One-Modell auswertet: eine E-Mail, ein Ticket, ein JSON-Dokument, ein Abschnitt Vertragstext. Jede Frage in einer Anfrage wird unabhängig gegen denselben Zustand ausgewertet. Eine praktische Folge: Mehr Fragen ändern die Latenz kaum, und mehr Fragen verschlechtern den Kontext nicht.

See also question · choice

Original Zustand

questionFrage (Primitiv)

Eine typisierte Frage, die an den Zustand gestellt wird. Es gibt genau drei: choice, score und noul. Sie heißen Primitive in Anlehnung an Software-Primitive — modular, kombinierbar, strukturiert. Du kannst alle drei mischen und in einer einzigen Anfrage viele auf einmal stellen.

See also choice · score · noul

Original Primitive (Fragen)

choicechoice (Auswahl)

Wähle eine Option aus einer definierten Menge. Jevs Choice akzeptiert bis zu 255 Optionen. Neben dem ausgewählten Element erhältst du eine Wahrscheinlichkeit für jede Option und eine Gesamtkonfidenz. Gut geeignet für Klassifikation, Routing und dafür, einen Kandidaten aus vielen auszuwählen.

See also score · noul · confidence

Original Choice

scorescore (Bewertung)

Verorte den Zustand auf einer geordneten, beschriebenen Skala. Die Antwort ist ein score, eine Wahrscheinlichkeit für jede Stufe und die Konfidenz. Der Unterschied zu choice ist, dass die Stufen geordnet sind. Ein häufiger Fehler ist eine zusammengesetzte Frage — zerlege sie in atomare score und kombiniere sie mit Gewichten, die du im Code selbst festlegst.

See also choice · noul · confidence

Original Score

noulnoul (Ja/Nein-Urteil)

Stelle eine Ja/Nein-Frage und erhalte die Wahrscheinlichkeit, dass die Antwort „Ja“ lautet (0–1). Nicht dasselbe wie Konfidenz: Ein noul ist eine Wahrscheinlichkeit über die Welt, die Konfidenz ist, wie zuverlässig das Modell sein eigenes Urteil einschätzt.

See also confidence · choice

Original Noul

confidenceKonfidenz (confidence)

Wie sicher sich das Modell bei seinem eigenen Urteil ist. Das ist die nützlichste Ausgabe: Die Antwort sagt dir, was, die Konfidenz sagt dir, ob du danach handeln solltest. Der typische Einsatz ist Gating — oberhalb eines Schwellenwerts automatisch anwenden, darunter an einen Menschen weiterleiten. Beachte, dass nicht jeder Fragetyp sie zurückgibt: choice und score tun es, noul nicht, da er selbst eine Wahrscheinlichkeit ist.

See also noul · score

Original Konfidenz

calibrationKalibrierung

Ob die Wahrscheinlichkeiten halten, was sie versprechen: Von den Stichproben, die das Modell als 70% bezeichnet, sollten tatsächlich etwa 70% positiv sein. Beide Modelle trainieren dies mit bestärkendem Lernen gegen strikt proprien Scoring-Regeln (Jev nennt es RLCD), und es ist die Voraussetzung dafür, Konfidenz als Gate zu verwenden. Eine unkalibrierte Konfidenz ist nur eine Zahl.

⚠️ Mit einem Kalibrierungsziel zu trainieren ist nicht dasselbe wie kalibrierte Wahrscheinlichkeiten auszugeben. Es gibt öffentliche Gegenbelege: In einem unabhängigen Experiment sollte Jev 400-mal einen fairen Würfel erraten und wählte jedes Mal dieselbe Seite, bei durchschnittlich selbst angegebenen 82.9% gegenüber einer tatsächlichen Trefferquote von 19.0%; ein vorregistrierter Out-of-Distribution-Test fand entgegengesetzte Verzerrungsrichtungen je Primitiv. Behandle Konfidenz im Produktivbetrieb als zu kalibrierenden Prior und miss das vertrauenswürdige Band an deinen eigenen Daten — siehe die Messungen und die Schwellenwertwahl im Leitfaden.

Projekte SemIf4,162★ · NanoJev2,159★ →

See also confidence · noul

Original Konfidenz

escalationEskalation (Übergabe an einen Menschen)

Eine Entscheidung an einen Menschen zu übergeben, wenn die Konfidenz im mittleren Band landet. Das ist eine entworfene Stufe, kein Fehlerzweig: oberhalb automatisch anwenden, unterhalb verwerfen, das Band dazwischen eskalieren. Zwei Dinge werden leicht übersehen: Das Band ist ein menschlicher Aufwand (breiteres Band, mehr menschliche Arbeit), und die Eskalation braucht ein Fail-Safe — ohne eines bleibt ein nicht übernommener Eintrag für immer liegen, während das Dashboard genauso aussieht wie „alles in Ordnung“.

Projekte fast-jev-compaction6,653★ · foreman540★ →

See also confidence · calibration

Original Konfidenz-gesteuertes Routing

cascadeKaskade

Lass zuerst die günstige Stufe entscheiden und schicke nur das, wobei sie unsicher ist, an das teurere Modell. Die Einsparung entspricht dem Anteil des Verkehrs innerhalb der Region hoher Konfidenz — in einer Messung wurden 37% der Fälle bei ≥90% Konfidenz abschließend entschieden und 37% der Aufrufe des großen Modells eingespart —, nicht einem festen Prozentsatz. Sie setzt voraus, dass sich das kleinere Modell wie Zufallsrauschen irrt; ist es bei einer Eingabeklasse systematisch zu selbstsicher, wird diese Klasse nie eskaliert.

Projekte jev-review (devagrawal09)586★ · jev-search446★ →

See also escalation · fan-out

Original SDE-Kaskade

fan-out

Stelle viele Fragen in einer Anfrage und lass deinen Code die nützlichen Antworten behalten. Was du sparst, ist vor allem Eingabe: Derselbe Zustand geht einmal raus, je mehr Fragen, desto dünner verteilt sich also der feste Aufwand pro Anfrage (eine Messung: 76–86% mediane Einsparung bei Eingabe-Tokens mit 8 parallelen Fragen). ⚠️ Es eignet sich für unabhängige Urteile — Klassifikation, Bewertung, Filterung — und nicht für Ranking, bei dem Elemente miteinander verglichen werden müssen: Ein Benchmark ergab, dass der Batch-Pfad sein Ranking-Qualitätsgate nicht besteht.

Projekte jev-review (devagrawal09)586★ · jev-search446★ →

See also cascade · question

Original Spekulativer Fan-Out

guardrailLeitplanke (guardrail)

Ein strukturiertes Urteil, angewendet, bevor Inhalt in ein System gelangt oder es verlässt, das über Durchlassen / Prüfen / Blockieren / Umleiten entscheidet. Der entscheidende Trade-off ist nicht der Schwellenwert, sondern in welche Richtung er bei einem Fehler kippt: Risiko-Leitplanken (Berechtigungen, Geheimnisse, gefährliche Aktionen) sollten fail-closed sein, Durchsatz-Leitplanken (Abschlussprüfungen, Formatprüfungen) sollten fail-open sein. Eine zweite wiederkehrende Praxis ist, zuerst deterministische Regeln laufen zu lassen und dem Modell nur die Grauzone zu überlassen, die die Regeln nicht entscheiden können.

Projekte fast-jev-compaction6,653★ · foreman540★ →

See also escalation · noul

Original Leitplanken für LLMs

abstentionEnthaltung

Der Mechanismus, mit dem ein Modell Antworten markiert, bei denen es unsicher ist, ohne sie zu verwerfen. Gib einer Anfrage einen min_confidence-Schwellenwert, und jede Antwort darunter kommt als low_confidence markiert zurück — die Antwort selbst wird weiterhin zurückgegeben, und der Aufrufer entscheidet, was zu tun ist. Das Gate meldet einen von drei Zuständen: passed, abstained oder unevaluated (die Antwort trug keine brauchbare Konfidenz, sodass das Gate nicht entscheiden konnte). Ohne gesetzten Schwellenwert erscheint keiner der Schlüssel: die Abwesenheit ist der Bericht, kein vierter Zustand.

See also confidence · calibration · guardrail

Original HTTP-API

local deploymentlokales Deployment

Die Praxis, offene Entscheidungsmodelle auf der eigenen Maschine laufen zu lassen — Ollaya ist ein fertiger Weg dafür. Die Kennzeichen: Die Gewichte liegen auf der lokalen Festplatte, der Dienst lauscht auf einer Loopback-Adresse wie 127.0.0.1:11435, es wird nichts pro Aufruf berechnet, und deine Daten bleiben in deiner eigenen Umgebung. Deployment und Modell sind zwei Schichten: Ein Deployment kann viele Modelle bedienen, und die Genauigkeit, die du bekommst, ist die des Modells, nicht die des Deployments.

See also System One

Original Ollaya · Quickstart