Документация

Открытые реплики и экосистема systemone

Другие страницы этого руководства о том, как пользоваться этими моделями. Эта — о том, какую выбрать, и почему на этот вопрос сейчас и ответить проще, чем год назад, и ошибиться легче.

Один интерфейс стал де-факто стандартом

POST /v1/systemone уже не просто деталь официального SDK. Он стал стандартом, потому что стоимость миграции на стороне клиента близка к нулю: сменить бэкенд означает поменять переменную окружения с базовым URL, а формы запроса и ответа не меняются.

Так появились десятки проектов, реализующих один и тот же интерфейс — от «превратить любую открытую модель в модель принятия решений» (читать логиты, не генерировать текст) до дообучений на открытых базах, до чисто локальных сред выполнения, до мостов, адаптирующих другие экосистемы.

Где находятся локальные альтернативы

Открытые реплики охватывают пять порядков по числу параметров — от нескольких сотен тысяч до 27B:

Реализация Масштаб Лицензия Что стоит отметить
Laya неавторегрессионная, ~35 мс на прямой проход Apache-2.0 Неавторегрессионная, с калиброванными через RLCD вероятностями; на PyPI / Hugging Face
von 395M — менее 15 мс на прямой проход
TinyJev 596M — pointer-голова, возвращает калиброванную уверенность, предназначенную для порогового отсечения
NanoJev 0.6B — полное распределение вероятностей за один проход, поставляется с пайплайном обучения, весами и датасетом
Verdict 118M Apache-2.0 temperature scaling + split-conformal множество отказа; заявляет, что проигрывает Laya на типизированных решениях
jevos 1B (MiniCPM5, урезанной до 17 слоёв) MIT GGUF q4_k_m размером 619 МБ; 54 мс на коротких / 220 мс на длинных запросах на CPU
CLM 8B — сообщает о задержке до 9× ниже
Jebadiah 27B / 9B / 4B Apache-2.0 распространяется как bf16 / GGUF / MLX

Несколько чисел, достаточно конкретных, чтобы их проверить:

  • Реализация на 1B для CPU (GGUF, 619 МБ) занимает 54 мс на коротких запросах и 220 мс на длинных, против 344 / 345 мс у хостингового сервиса — но набирает 0.815 против 0.927 и отвечает только на вопросы да/нет.
  • Другая открытая модель набирает 33.1% против 36.7% на 308 закрытых решениях (около 13 мс).
  • Специализированная модель для заполнения форм (706,048 параметров, 2.8 МБ) достигает 99.7% на своей задаче там, где общая модель получает 83.6% — и авторы прямо говорят, что это преимущество на своём поле, а не универсальная победа.

Эта таблица должна передавать порядки величин, а не рейтинг. «В шесть раз быстрее, но на одиннадцать пунктов менее точно» и «сопоставимая точность, но только один тип вопросов» — совершенно разные компромиссы, и оба можно описать как «локальную замену».

Совместимость: число, которое нельзя пропустить

Когда экосистема становится оживлённой, вопрос в том, действительно ли все соблюдают один и тот же интерфейс.

Один проект превратил семантику /v1/systemone в 48 проверяемых требований (например: вероятности вариантов у Choice по определению дают в сумме 1; математическое ожидание Score равно сумме с весами-вероятностями; число вариантов идёт от 2 до 255; ответы не меняются при изменении порядка вопросов) и поставляет набор тестов, проверяющий любой сервер, заявляющий о совместимости.

Его измеренный результат:

Из восьми самых звёздных открытых реализаций полностью совместимы только две.

Это бьёт в две стороны. Для клиентов это значит, что «просто смените базовый URL» нужно подтверждать этим набором тестов, а не предполагать. Для тех, кто делает замену, это указывает на ось дифференциации, которой легче достичь, чем точности, и которая куда менее людная.

Что это значит для выбора

Собирая всё вместе: центр тяжести сместился с вопроса «какая модель набирает больше»:

  1. Интерфейс общий, а модель заменяема. Те 48 требований и есть определение заменяемости — сначала подтвердите их набором тестов, потом говорите обо всём остальном.
  2. Ров сместился за пределы модели. Как только модельный слой становится товаром, трудно скопировать контракт интерфейса + политику порогов + калибровку на ваших собственных данных. Именно о них и другие страницы здесь, и все три живут в вашем репозитории, а не у поставщика.
  3. Ставьте разрывы в точности в правильные координаты. «83.6% против 99.7%» — это специалист на своём поле; «0.815 против 0.927» — это маленькая модель на CPU, которая отвечает только да/нет. Говорите обе половины, иначе таблица вводит в заблуждение.

Размер экосистемы

Публичный след экосистемы — примерно 1,100 проектов (сентябрь 2026).

Объём — это не качество и не зрелость. Этот подсчёт включает великое множество проектов из одного коммита, делящих один каркас: один автор выпускает пачку репозиториев в один день, с общим AGENTS.md, историей из одного коммита и заметно большим объёмом прозы, чем кода. Они могут быть вполне законными — они просто непроверены. Фильтруйте по «есть ли что-то запускаемое», а не по «попало ли оно в список».

В одном предложении

Модельный слой становится расходным материалом; интерфейс, пороги и калибровка — нет. Вкладывайте усилия в последние три — первый заменим в любой момент.