Documentação

Réplicas abertas e o ecossistema systemone

Outras páginas deste guia tratam de como usar estes modelos. Esta trata de qual escolher — e por que essa pergunta é ao mesmo tempo mais fácil de responder do que um ano atrás e mais fácil de errar.

Uma interface se tornou o padrão de facto

POST /v1/systemone já não é apenas um detalhe do SDK oficial. Ele se tornou um padrão porque o custo de migração do lado do cliente é próximo de zero: trocar de backend significa mudar uma variável de ambiente de URL base, sem alterar as formas de requisição e resposta.

Isso produziu dezenas de projetos implementando a mesma interface — de “transforme qualquer modelo aberto em um modelo de decisão” (leia os logits, não gere texto), a ajustes finos sobre bases abertas, a runtimes puramente locais, a pontes que adaptam outros ecossistemas.

Onde ficam as alternativas locais

As réplicas abertas abrangem cinco ordens de magnitude em contagem de parâmetros, de algumas centenas de milhares a 27B:

Implementação Escala Licença Vale notar
Laya não autorregressiva, ~35 ms por passagem direta Apache-2.0 Não autorregressiva com probabilidades calibradas por RLCD; no PyPI / Hugging Face
von 395M — menos de 15 ms por passagem direta
TinyJev 596M — cabeça de ponteiro, retorna confiança calibrada feita para ser limitada por limiar
NanoJev 0.6B — distribuição de probabilidade completa em uma passagem, entregue com pipeline de treinamento, pesos e conjunto de dados
Verdict 118M Apache-2.0 escala de temperatura + conjunto de abstenção split-conformal; afirma que perde para a Laya em decisões tipadas
jevos 1B (MiniCPM5 cortado em 17 camadas) MIT GGUF q4_k_m com 619 MB; 54 ms curto / 220 ms longo na CPU
CLM 8B — relata latência até 9× menor
Jebadiah 27B / 9B / 4B Apache-2.0 distribuído como bf16 / GGUF / MLX

Alguns números concretos o suficiente para verificar:

  • Uma implementação de 1B na CPU (GGUF, 619 MB) leva 54 ms em requisições curtas e 220 ms em longas, contra 344 / 345 ms do serviço hospedado — mas pontua 0.815 versus 0.927, e responde apenas perguntas de sim/não.
  • Outro peso aberto pontua 33.1% versus 36.7% em 308 decisões seladas (cerca de 13 ms).
  • Um modelo especialista em preenchimento de formulários (706,048 parâmetros, 2.8 MB) alcança 99.7% na própria tarefa onde o modelo geral obtém 83.6% — e os autores dizem explicitamente que isso é vantagem em casa, não uma vitória geral.

O que esta tabela deve transmitir são magnitudes, não um ranking. “Seis vezes mais rápido mas onze pontos menos preciso” e “precisão comparável mas apenas um tipo de pergunta” são trade-offs completamente diferentes, e ambos podem ser descritos como “um substituto local”.

Conformidade: o número que você não deve pular

Quando um ecossistema fica movimentado, a pergunta a fazer é se todos realmente honram a mesma interface.

Um projeto transformou a semântica de /v1/systemone em 48 requisitos verificáveis (por exemplo: as probabilidades das opções de um Choice somam 1 por definição; a esperança de um Score é igual à soma ponderada pelas probabilidades; a contagem de opções vai de 2 a 255; as respostas não mudam quando a ordem das perguntas muda) e entrega uma suíte que testa qualquer servidor que alegue compatibilidade.

O resultado medido:

Dos oito portes abertos com mais estrelas, apenas dois eram totalmente compatíveis.

Isso corta dos dois lados. Para clientes, significa que “basta mudar a URL base” precisa ser confirmado com a suíte, não presumido. Para quem está construindo um substituto, aponta para um eixo de diferenciação mais fácil de alcançar do que a precisão e muito menos concorrido.

O que isso significa para escolher

Juntando tudo, o centro de gravidade se afastou de “qual modelo pontua mais”:

  1. A interface é compartilhada e o modelo é substituível. Aqueles 48 requisitos são a definição de substituibilidade — confirme-os com a suíte primeiro, depois fale de qualquer outra coisa.
  2. O fosso se moveu para fora do modelo. Uma vez que a camada de modelos é uma mercadoria, o que é difícil de copiar é o contrato da interface + a política de limiar + a calibração sobre os seus próprios dados. É exatamente disso que as outras páginas aqui tratam, e os três vivem no seu repositório, não no do seu fornecedor.
  3. Coloque as diferenças de precisão nas coordenadas certas. “83.6% vs 99.7%” é um especialista em casa; “0.815 vs 0.927” é um modelo pequeno rodando na CPU que só responde sim/não. Diga as duas metades, ou a tabela engana.

O tamanho do ecossistema

A pegada pública do ecossistema é de aproximadamente 1,100 projetos (setembro de 2026).

Volume não é qualidade, e não é maturidade. Essa contagem inclui uma grande quantidade de projetos de um único commit compartilhando um mesmo andaime: um autor lançando um lote de repositórios no mesmo dia, compartilhando um AGENTS.md, um histórico de um único commit e consideravelmente mais prosa do que código. Eles podem ser inteiramente legítimos — são simplesmente não comprovados. Filtre por “há algo executável”, não por “apareceu numa lista”.

Em uma frase

A camada de modelos está se tornando um consumível; a interface, os limiares e a calibração não. Gaste seu esforço nos três últimos — o primeiro é substituível a qualquer momento.