Réplicas abertas e o ecossistema systemone
As outras páginas deste guia são sobre como usar estes modelos. Esta é sobre qual — e porque é que essa pergunta é simultaneamente mais fácil de responder do que há um ano e mais fácil de errar.
Uma interface tornou-se o padrão de facto
POST /v1/systemone já não é apenas um detalhe do SDK oficial. Tornou-se um padrão porque o
custo de migração do lado do cliente é quase zero: mudar de backend significa mudar uma
variável de ambiente de URL base, com as formas do pedido e da resposta inalteradas.
Isso produziu dezenas de projetos que implementam a mesma interface — desde «transforma qualquer modelo aberto num modelo de decisão» (lê os logits, não gera texto), a ajustes finos sobre bases abertas, a runtimes puramente locais, a pontes que adaptam outros ecossistemas.
Onde se situam as alternativas locais
As réplicas abertas abrangem cinco ordens de magnitude em número de parâmetros, de algumas centenas de milhares a 27B:
| Implementação | Escala | Licença | A assinalar |
|---|---|---|---|
| Laya | não autorregressivo, ~35 ms por passagem direta | Apache-2.0 | Não autorregressivo com probabilidades calibradas por RLCD; no PyPI / Hugging Face |
| von | 395M | — | menos de 15 ms por passagem direta |
| TinyJev | 596M | — | cabeça pointer, devolve confiança calibrada destinada a ser comparada com um limiar |
| NanoJev | 0.6B | — | distribuição de probabilidade completa numa só passagem, distribuído com pipeline de treino, pesos e dataset |
| Verdict | 118M | Apache-2.0 | temperature scaling + conjunto de abstenção split-conformal; afirma que perde para o Laya em decisões tipadas |
| jevos | 1B (MiniCPM5 reduzido a 17 camadas) | MIT | GGUF q4_k_m com 619 MB; 54 ms curto / 220 ms longo na CPU |
| CLM | 8B | — | reporta até 9× menos latência |
| Jebadiah | 27B / 9B / 4B | Apache-2.0 | distribuído como bf16 / GGUF / MLX |
Alguns números suficientemente concretos para verificar:
- Uma implementação de 1B na CPU (GGUF, 619 MB) leva 54 ms em pedidos curtos e 220 ms em longos, contra 344 / 345 ms do serviço alojado — mas obtém 0.815 contra 0.927, e só responde a perguntas de sim/não.
- Outro peso aberto obtém 33.1% contra 36.7% em 308 decisões seladas (cerca de 13 ms).
- Um modelo especialista de preenchimento de formulários (706,048 parâmetros, 2.8 MB) atinge 99.7% na sua própria tarefa onde o modelo geral obtém 83.6% — e os autores dizem explicitamente que isto é vantagem em casa, não uma vitória geral.
O que esta tabela deve transmitir são magnitudes, não um ranking. «Seis vezes mais rápido mas onze pontos menos preciso» e «precisão comparável mas apenas um tipo de pergunta» são compromissos completamente diferentes, e ambos podem ser descritos como «um substituto local».
Conformidade: o número a não saltar
Quando um ecossistema fica movimentado, a pergunta a fazer é se todos honram realmente a mesma interface.
Um projeto transformou a semântica de /v1/systemone em 48 requisitos verificáveis
(por exemplo: as probabilidades das opções de um Choice somam 1 por definição; a esperança de
um Score é igual à soma ponderada pelas probabilidades; o número de opções vai de 2 a 255; as
respostas não mudam quando a ordem das perguntas muda) e distribui uma suite que testa qualquer
servidor que reivindique compatibilidade.
O seu resultado medido:
Das oito portas abertas com mais estrelas, apenas duas eram totalmente conformes.
Isso corta nos dois sentidos. Para os clientes, significa que «basta mudar o URL base» tem de ser confirmado com a suite, não assumido. Para quem constrói um substituto, aponta para um eixo de diferenciação mais fácil de alcançar do que a precisão e muito menos concorrido.
O que isto significa para escolher
Juntando tudo, o centro de gravidade afastou-se de «qual modelo obtém melhor pontuação»:
- A interface é partilhada e o modelo é substituível. Esses 48 requisitos são a definição de substituibilidade — confirma-os primeiro com a suite e só depois fala de qualquer outra coisa.
- O fosso mudou para fora do modelo. Assim que a camada dos modelos é uma mercadoria, o que é difícil de copiar é o contrato da interface + a política de limiares + a calibração nos teus próprios dados. São exatamente aquilo de que falam as outras páginas daqui, e os três vivem no teu repositório, não no do teu fornecedor.
- Coloca as diferenças de precisão nas coordenadas certas. «83.6% vs 99.7%» é um especialista em casa; «0.815 vs 0.927» é um modelo pequeno a correr na CPU que só responde a sim/não. Diz as duas metades, ou a tabela engana.
A dimensão do ecossistema
A pegada pública do ecossistema é de cerca de 1,100 projetos (setembro de 2026).
O volume não é qualidade, e não é maturidade. Essa contagem inclui um grande número de
projetos de um único commit que partilham um só esqueleto: um autor que lança um lote de
repositórios no mesmo dia, a partilhar um AGENTS.md, um histórico de um único commit e
consideravelmente mais prosa do que código. Podem ser inteiramente legítimos — são simplesmente
não comprovados. Filtra por «há algo executável», não por «apareceu numa lista».
Numa frase
A camada dos modelos está a tornar-se um consumível; a interface, os limiares e a calibração não são. Gasta o teu esforço nos últimos três — o primeiro é substituível a qualquer momento.