Offene Replikate und das systemone-Ökosystem
Andere Seiten in diesem Leitfaden handeln davon, wie man diese Modelle verwendet. Diese hier handelt davon, welches — und warum diese Frage sowohl leichter zu beantworten ist als noch vor einem Jahr als auch leichter falsch zu beantworten.
Eine Schnittstelle wurde zum De-facto-Standard
POST /v1/systemone ist längst kein Detail des offiziellen SDK mehr. Es wurde zum Standard,
weil die clientseitigen Migrationskosten nahe null sind: Ein Backend-Wechsel bedeutet, eine
Umgebungsvariable mit der Basis-URL zu ändern, ohne dass sich die Form von Anfragen und Antworten
ändert.
Daraus entstanden Dutzende Projekte, die dieselbe Schnittstelle implementieren — vom „verwandle jedes offene Modell in ein Entscheidungsmodell” (die Logits lesen, keinen Text erzeugen) über Fine-Tuning auf offenen Basen bis hin zu rein lokalen Runtimes und Brücken, die andere Ökosysteme anpassen.
Wo die lokalen Alternativen stehen
Offene Replikate umfassen fünf Größenordnungen bei der Parameterzahl, von ein paar Hunderttausend bis 27B:
| Implementierung | Skala | Lizenz | Bemerkenswert |
|---|---|---|---|
| Laya | nicht-autoregressiv, ~35 ms pro Vorwärtsdurchlauf | Apache-2.0 | Nicht-autoregressiv mit RLCD-kalibrierten Wahrscheinlichkeiten; auf PyPI / Hugging Face |
| von | 395M | — | unter 15 ms pro Vorwärtsdurchlauf |
| TinyJev | 596M | — | Pointer-Kopf, liefert eine kalibrierte Konfidenz, die zum Schwellenwertvergleich gedacht ist |
| NanoJev | 0.6B | — | vollständige Wahrscheinlichkeitsverteilung in einem Durchlauf, mit Trainings-Pipeline, Gewichten und Datensatz |
| Verdict | 118M | Apache-2.0 | Temperatur-Skalierung + Split-Conformal-Abstain-Set; erklärt, dass es bei typisierten Entscheidungen gegen Laya verliert |
| jevos | 1B (MiniCPM5 auf 17 Schichten gekürzt) | MIT | GGUF q4_k_m mit 619 MB; 54 ms kurz / 220 ms lang auf CPU |
| CLM | 8B | — | meldet bis zu 9× geringere Latenz |
| Jebadiah | 27B / 9B / 4B | Apache-2.0 | verteilt als bf16 / GGUF / MLX |
Ein paar Zahlen, konkret genug zum Nachprüfen:
- Eine 1B-CPU-Implementierung (GGUF, 619 MB) braucht 54 ms bei kurzen Anfragen und 220 ms bei langen, gegenüber 344 / 345 ms für den gehosteten Dienst — punktet aber 0.815 gegenüber 0.927 und beantwortet nur Ja/Nein-Fragen.
- Ein weiteres offenes Gewicht punktet 33.1% gegenüber 36.7% bei 308 versiegelten Entscheidungen (etwa 13 ms).
- Ein spezialisiertes Formular-Ausfüllmodell (706.048 Parameter, 2,8 MB) erreicht 99,7% bei seiner eigenen Aufgabe, wo das allgemeine Modell 83,6% erreicht — und die Autoren sagen ausdrücklich, dass dies Heimvorteil ist, kein allgemeiner Sieg.
Was diese Tabelle vermitteln soll, sind Größenordnungen, keine Rangliste. „Sechsmal schneller, aber elf Punkte ungenauer” und „vergleichbare Genauigkeit, aber nur ein Fragetyp” sind völlig unterschiedliche Abwägungen, und beide lassen sich als „ein lokaler Ersatz” beschreiben.
Compliance: die Zahl, die man nicht überspringen sollte
Wenn ein Ökosystem geschäftig wird, ist die Frage, die man stellen sollte: ob wirklich alle dieselbe Schnittstelle einhalten.
Ein Projekt verwandelte die Semantik von /v1/systemone in 48 überprüfbare Anforderungen
(zum Beispiel: Die Optionswahrscheinlichkeiten eines Choice summieren sich per Definition zu 1;
der Erwartungswert eines Score entspricht der wahrscheinlichkeitsgewichteten Summe; die
Optionsanzahl reicht von 2 bis 255; die Antworten ändern sich nicht, wenn sich die Reihenfolge der
Fragen ändert) und liefert eine Suite mit, die jeden Server testet, der Kompatibilität
beansprucht.
Sein gemessenes Ergebnis:
Von den acht offenen Ports mit den meisten Sternen waren nur zwei vollständig konform.
Das schneidet in zwei Richtungen. Für Clients heißt es, dass „ändere einfach die Basis-URL” mit der Suite bestätigt werden muss, nicht vorausgesetzt. Für jeden, der einen Ersatz baut, zeigt es auf eine Differenzierungsachse, die leichter zu erreichen ist als Genauigkeit und weit weniger überfüllt.
Was das für die Auswahl bedeutet
Zusammengenommen hat sich der Schwerpunkt von „welches Modell punktet höher” weg verschoben:
- Die Schnittstelle ist geteilt und das Modell ersetzbar. Diese 48 Anforderungen sind die Definition von Ersetzbarkeit — bestätige sie zuerst mit der Suite und sprich dann über alles andere.
- Der Burggraben hat sich aus dem Modell heraus verlagert. Sobald die Modellschicht eine Ware ist, ist das schwer zu Kopierende der Schnittstellenvertrag + die Schwellenwert-Politik + die Kalibrierung auf deinen eigenen Daten. Genau darum geht es auf den anderen Seiten hier, und alle drei leben in deinem Repository, nicht in dem deines Anbieters.
- Setze Genauigkeitslücken in die richtigen Koordinaten. „83,6% vs. 99,7%” ist ein Spezialist auf seinem Heimatterrain; „0.815 vs. 0.927” ist ein kleines Modell, das auf CPU läuft und nur Ja/Nein beantwortet. Sag beide Hälften, sonst führt die Tabelle in die Irre.
Die Größe des Ökosystems
Der öffentliche Fußabdruck des Ökosystems beträgt grob 1.100 Projekte (September 2026).
Volumen ist keine Qualität, und es ist keine Reife. Diese Zahl enthält sehr viele
Einzel-Commit-Projekte, die sich ein Gerüst teilen: ein Autor, der am selben Tag eine Reihe
von Repositories veröffentlicht, mit einer gemeinsamen AGENTS.md, einer Einzel-Commit-Historie
und deutlich mehr Prosa als Code. Sie mögen völlig legitim sein — sie sind einfach unbewiesen.
Filtere nach „gibt es etwas Ausführbares”, nicht nach „ist es in einer Liste erschienen”.
In einem Satz
Die Modellschicht wird zu einem Verbrauchsgut; die Schnittstelle, die Schwellenwerte und die Kalibrierung nicht. Stecke deine Mühe in die letzten drei — das erste ist jederzeit ersetzbar.