Documentação

Réplicas abertas e o ecossistema systemone

As outras páginas deste guia são sobre como usar estes modelos. Esta é sobre qual — e porque é que essa pergunta é simultaneamente mais fácil de responder do que há um ano e mais fácil de errar.

Uma interface tornou-se o padrão de facto

POST /v1/systemone já não é apenas um detalhe do SDK oficial. Tornou-se um padrão porque o custo de migração do lado do cliente é quase zero: mudar de backend significa mudar uma variável de ambiente de URL base, com as formas do pedido e da resposta inalteradas.

Isso produziu dezenas de projetos que implementam a mesma interface — desde «transforma qualquer modelo aberto num modelo de decisão» (lê os logits, não gera texto), a ajustes finos sobre bases abertas, a runtimes puramente locais, a pontes que adaptam outros ecossistemas.

Onde se situam as alternativas locais

As réplicas abertas abrangem cinco ordens de magnitude em número de parâmetros, de algumas centenas de milhares a 27B:

Implementação Escala Licença A assinalar
Laya não autorregressivo, ~35 ms por passagem direta Apache-2.0 Não autorregressivo com probabilidades calibradas por RLCD; no PyPI / Hugging Face
von 395M — menos de 15 ms por passagem direta
TinyJev 596M — cabeça pointer, devolve confiança calibrada destinada a ser comparada com um limiar
NanoJev 0.6B — distribuição de probabilidade completa numa só passagem, distribuído com pipeline de treino, pesos e dataset
Verdict 118M Apache-2.0 temperature scaling + conjunto de abstenção split-conformal; afirma que perde para o Laya em decisões tipadas
jevos 1B (MiniCPM5 reduzido a 17 camadas) MIT GGUF q4_k_m com 619 MB; 54 ms curto / 220 ms longo na CPU
CLM 8B — reporta até 9× menos latência
Jebadiah 27B / 9B / 4B Apache-2.0 distribuído como bf16 / GGUF / MLX

Alguns números suficientemente concretos para verificar:

  • Uma implementação de 1B na CPU (GGUF, 619 MB) leva 54 ms em pedidos curtos e 220 ms em longos, contra 344 / 345 ms do serviço alojado — mas obtém 0.815 contra 0.927, e só responde a perguntas de sim/não.
  • Outro peso aberto obtém 33.1% contra 36.7% em 308 decisões seladas (cerca de 13 ms).
  • Um modelo especialista de preenchimento de formulários (706,048 parâmetros, 2.8 MB) atinge 99.7% na sua própria tarefa onde o modelo geral obtém 83.6% — e os autores dizem explicitamente que isto é vantagem em casa, não uma vitória geral.

O que esta tabela deve transmitir são magnitudes, não um ranking. «Seis vezes mais rápido mas onze pontos menos preciso» e «precisão comparável mas apenas um tipo de pergunta» são compromissos completamente diferentes, e ambos podem ser descritos como «um substituto local».

Conformidade: o número a não saltar

Quando um ecossistema fica movimentado, a pergunta a fazer é se todos honram realmente a mesma interface.

Um projeto transformou a semântica de /v1/systemone em 48 requisitos verificáveis (por exemplo: as probabilidades das opções de um Choice somam 1 por definição; a esperança de um Score é igual à soma ponderada pelas probabilidades; o número de opções vai de 2 a 255; as respostas não mudam quando a ordem das perguntas muda) e distribui uma suite que testa qualquer servidor que reivindique compatibilidade.

O seu resultado medido:

Das oito portas abertas com mais estrelas, apenas duas eram totalmente conformes.

Isso corta nos dois sentidos. Para os clientes, significa que «basta mudar o URL base» tem de ser confirmado com a suite, não assumido. Para quem constrói um substituto, aponta para um eixo de diferenciação mais fácil de alcançar do que a precisão e muito menos concorrido.

O que isto significa para escolher

Juntando tudo, o centro de gravidade afastou-se de «qual modelo obtém melhor pontuação»:

  1. A interface é partilhada e o modelo é substituível. Esses 48 requisitos são a definição de substituibilidade — confirma-os primeiro com a suite e só depois fala de qualquer outra coisa.
  2. O fosso mudou para fora do modelo. Assim que a camada dos modelos é uma mercadoria, o que é difícil de copiar é o contrato da interface + a política de limiares + a calibração nos teus próprios dados. São exatamente aquilo de que falam as outras páginas daqui, e os três vivem no teu repositório, não no do teu fornecedor.
  3. Coloca as diferenças de precisão nas coordenadas certas. «83.6% vs 99.7%» é um especialista em casa; «0.815 vs 0.927» é um modelo pequeno a correr na CPU que só responde a sim/não. Diz as duas metades, ou a tabela engana.

A dimensão do ecossistema

A pegada pública do ecossistema é de cerca de 1,100 projetos (setembro de 2026).

O volume não é qualidade, e não é maturidade. Essa contagem inclui um grande número de projetos de um único commit que partilham um só esqueleto: um autor que lança um lote de repositórios no mesmo dia, a partilhar um AGENTS.md, um histórico de um único commit e consideravelmente mais prosa do que código. Podem ser inteiramente legítimos — são simplesmente não comprovados. Filtra por «há algo executável», não por «apareceu numa lista».

Numa frase

A camada dos modelos está a tornar-se um consumível; a interface, os limiares e a calibração não são. Gasta o teu esforço nos últimos três — o primeiro é substituível a qualquer momento.