Dokumentation

Offene Replikate und das systemone-Ökosystem

Andere Seiten in diesem Leitfaden handeln davon, wie man diese Modelle verwendet. Diese hier handelt davon, welches — und warum diese Frage sowohl leichter zu beantworten ist als noch vor einem Jahr als auch leichter falsch zu beantworten.

Eine Schnittstelle wurde zum De-facto-Standard

POST /v1/systemone ist längst kein Detail des offiziellen SDK mehr. Es wurde zum Standard, weil die clientseitigen Migrationskosten nahe null sind: Ein Backend-Wechsel bedeutet, eine Umgebungsvariable mit der Basis-URL zu ändern, ohne dass sich die Form von Anfragen und Antworten ändert.

Daraus entstanden Dutzende Projekte, die dieselbe Schnittstelle implementieren — vom „verwandle jedes offene Modell in ein Entscheidungsmodell” (die Logits lesen, keinen Text erzeugen) über Fine-Tuning auf offenen Basen bis hin zu rein lokalen Runtimes und Brücken, die andere Ökosysteme anpassen.

Wo die lokalen Alternativen stehen

Offene Replikate umfassen fünf Größenordnungen bei der Parameterzahl, von ein paar Hunderttausend bis 27B:

Implementierung Skala Lizenz Bemerkenswert
Laya nicht-autoregressiv, ~35 ms pro Vorwärtsdurchlauf Apache-2.0 Nicht-autoregressiv mit RLCD-kalibrierten Wahrscheinlichkeiten; auf PyPI / Hugging Face
von 395M — unter 15 ms pro Vorwärtsdurchlauf
TinyJev 596M — Pointer-Kopf, liefert eine kalibrierte Konfidenz, die zum Schwellenwertvergleich gedacht ist
NanoJev 0.6B — vollständige Wahrscheinlichkeitsverteilung in einem Durchlauf, mit Trainings-Pipeline, Gewichten und Datensatz
Verdict 118M Apache-2.0 Temperatur-Skalierung + Split-Conformal-Abstain-Set; erklärt, dass es bei typisierten Entscheidungen gegen Laya verliert
jevos 1B (MiniCPM5 auf 17 Schichten gekürzt) MIT GGUF q4_k_m mit 619 MB; 54 ms kurz / 220 ms lang auf CPU
CLM 8B — meldet bis zu 9× geringere Latenz
Jebadiah 27B / 9B / 4B Apache-2.0 verteilt als bf16 / GGUF / MLX

Ein paar Zahlen, konkret genug zum Nachprüfen:

  • Eine 1B-CPU-Implementierung (GGUF, 619 MB) braucht 54 ms bei kurzen Anfragen und 220 ms bei langen, gegenüber 344 / 345 ms für den gehosteten Dienst — punktet aber 0.815 gegenüber 0.927 und beantwortet nur Ja/Nein-Fragen.
  • Ein weiteres offenes Gewicht punktet 33.1% gegenüber 36.7% bei 308 versiegelten Entscheidungen (etwa 13 ms).
  • Ein spezialisiertes Formular-Ausfüllmodell (706.048 Parameter, 2,8 MB) erreicht 99,7% bei seiner eigenen Aufgabe, wo das allgemeine Modell 83,6% erreicht — und die Autoren sagen ausdrücklich, dass dies Heimvorteil ist, kein allgemeiner Sieg.

Was diese Tabelle vermitteln soll, sind Größenordnungen, keine Rangliste. „Sechsmal schneller, aber elf Punkte ungenauer” und „vergleichbare Genauigkeit, aber nur ein Fragetyp” sind völlig unterschiedliche Abwägungen, und beide lassen sich als „ein lokaler Ersatz” beschreiben.

Compliance: die Zahl, die man nicht überspringen sollte

Wenn ein Ökosystem geschäftig wird, ist die Frage, die man stellen sollte: ob wirklich alle dieselbe Schnittstelle einhalten.

Ein Projekt verwandelte die Semantik von /v1/systemone in 48 überprüfbare Anforderungen (zum Beispiel: Die Optionswahrscheinlichkeiten eines Choice summieren sich per Definition zu 1; der Erwartungswert eines Score entspricht der wahrscheinlichkeitsgewichteten Summe; die Optionsanzahl reicht von 2 bis 255; die Antworten ändern sich nicht, wenn sich die Reihenfolge der Fragen ändert) und liefert eine Suite mit, die jeden Server testet, der Kompatibilität beansprucht.

Sein gemessenes Ergebnis:

Von den acht offenen Ports mit den meisten Sternen waren nur zwei vollständig konform.

Das schneidet in zwei Richtungen. Für Clients heißt es, dass „ändere einfach die Basis-URL” mit der Suite bestätigt werden muss, nicht vorausgesetzt. Für jeden, der einen Ersatz baut, zeigt es auf eine Differenzierungsachse, die leichter zu erreichen ist als Genauigkeit und weit weniger überfüllt.

Was das für die Auswahl bedeutet

Zusammengenommen hat sich der Schwerpunkt von „welches Modell punktet höher” weg verschoben:

  1. Die Schnittstelle ist geteilt und das Modell ersetzbar. Diese 48 Anforderungen sind die Definition von Ersetzbarkeit — bestätige sie zuerst mit der Suite und sprich dann über alles andere.
  2. Der Burggraben hat sich aus dem Modell heraus verlagert. Sobald die Modellschicht eine Ware ist, ist das schwer zu Kopierende der Schnittstellenvertrag + die Schwellenwert-Politik + die Kalibrierung auf deinen eigenen Daten. Genau darum geht es auf den anderen Seiten hier, und alle drei leben in deinem Repository, nicht in dem deines Anbieters.
  3. Setze Genauigkeitslücken in die richtigen Koordinaten. „83,6% vs. 99,7%” ist ein Spezialist auf seinem Heimatterrain; „0.815 vs. 0.927” ist ein kleines Modell, das auf CPU läuft und nur Ja/Nein beantwortet. Sag beide Hälften, sonst führt die Tabelle in die Irre.

Die Größe des Ökosystems

Der öffentliche Fußabdruck des Ökosystems beträgt grob 1.100 Projekte (September 2026).

Volumen ist keine Qualität, und es ist keine Reife. Diese Zahl enthält sehr viele Einzel-Commit-Projekte, die sich ein Gerüst teilen: ein Autor, der am selben Tag eine Reihe von Repositories veröffentlicht, mit einer gemeinsamen AGENTS.md, einer Einzel-Commit-Historie und deutlich mehr Prosa als Code. Sie mögen völlig legitim sein — sie sind einfach unbewiesen. Filtere nach „gibt es etwas Ausführbares”, nicht nach „ist es in einer Liste erschienen”.

In einem Satz

Die Modellschicht wird zu einem Verbrauchsgut; die Schnittstelle, die Schwellenwerte und die Kalibrierung nicht. Stecke deine Mühe in die letzten drei — das erste ist jederzeit ersetzbar.