Réplicas abertas e o ecossistema systemone
Outras páginas deste guia tratam de como usar estes modelos. Esta trata de qual escolher — e por que essa pergunta é ao mesmo tempo mais fácil de responder do que um ano atrás e mais fácil de errar.
Uma interface se tornou o padrão de facto
POST /v1/systemone já não é apenas um detalhe do SDK oficial. Ele se tornou um padrão
porque o custo de migração do lado do cliente é próximo de zero: trocar de backend significa
mudar uma variável de ambiente de URL base, sem alterar as formas de requisição e resposta.
Isso produziu dezenas de projetos implementando a mesma interface — de “transforme qualquer modelo aberto em um modelo de decisão” (leia os logits, não gere texto), a ajustes finos sobre bases abertas, a runtimes puramente locais, a pontes que adaptam outros ecossistemas.
Onde ficam as alternativas locais
As réplicas abertas abrangem cinco ordens de magnitude em contagem de parâmetros, de algumas centenas de milhares a 27B:
| Implementação | Escala | Licença | Vale notar |
|---|---|---|---|
| Laya | não autorregressiva, ~35 ms por passagem direta | Apache-2.0 | Não autorregressiva com probabilidades calibradas por RLCD; no PyPI / Hugging Face |
| von | 395M | — | menos de 15 ms por passagem direta |
| TinyJev | 596M | — | cabeça de ponteiro, retorna confiança calibrada feita para ser limitada por limiar |
| NanoJev | 0.6B | — | distribuição de probabilidade completa em uma passagem, entregue com pipeline de treinamento, pesos e conjunto de dados |
| Verdict | 118M | Apache-2.0 | escala de temperatura + conjunto de abstenção split-conformal; afirma que perde para a Laya em decisões tipadas |
| jevos | 1B (MiniCPM5 cortado em 17 camadas) | MIT | GGUF q4_k_m com 619 MB; 54 ms curto / 220 ms longo na CPU |
| CLM | 8B | — | relata latência até 9× menor |
| Jebadiah | 27B / 9B / 4B | Apache-2.0 | distribuído como bf16 / GGUF / MLX |
Alguns números concretos o suficiente para verificar:
- Uma implementação de 1B na CPU (GGUF, 619 MB) leva 54 ms em requisições curtas e 220 ms em longas, contra 344 / 345 ms do serviço hospedado — mas pontua 0.815 versus 0.927, e responde apenas perguntas de sim/não.
- Outro peso aberto pontua 33.1% versus 36.7% em 308 decisões seladas (cerca de 13 ms).
- Um modelo especialista em preenchimento de formulários (706,048 parâmetros, 2.8 MB) alcança 99.7% na própria tarefa onde o modelo geral obtém 83.6% — e os autores dizem explicitamente que isso é vantagem em casa, não uma vitória geral.
O que esta tabela deve transmitir são magnitudes, não um ranking. “Seis vezes mais rápido mas onze pontos menos preciso” e “precisão comparável mas apenas um tipo de pergunta” são trade-offs completamente diferentes, e ambos podem ser descritos como “um substituto local”.
Conformidade: o número que você não deve pular
Quando um ecossistema fica movimentado, a pergunta a fazer é se todos realmente honram a mesma interface.
Um projeto transformou a semântica de /v1/systemone em 48 requisitos verificáveis
(por exemplo: as probabilidades das opções de um Choice somam 1 por definição; a
esperança de um Score é igual à soma ponderada pelas probabilidades; a contagem de opções vai de 2 a 255; as respostas
não mudam quando a ordem das perguntas muda) e entrega uma suíte que testa qualquer servidor que alegue
compatibilidade.
O resultado medido:
Dos oito portes abertos com mais estrelas, apenas dois eram totalmente compatíveis.
Isso corta dos dois lados. Para clientes, significa que “basta mudar a URL base” precisa ser confirmado com a suíte, não presumido. Para quem está construindo um substituto, aponta para um eixo de diferenciação mais fácil de alcançar do que a precisão e muito menos concorrido.
O que isso significa para escolher
Juntando tudo, o centro de gravidade se afastou de “qual modelo pontua mais”:
- A interface é compartilhada e o modelo é substituível. Aqueles 48 requisitos são a definição de substituibilidade — confirme-os com a suíte primeiro, depois fale de qualquer outra coisa.
- O fosso se moveu para fora do modelo. Uma vez que a camada de modelos é uma mercadoria, o que é difícil de copiar é o contrato da interface + a política de limiar + a calibração sobre os seus próprios dados. É exatamente disso que as outras páginas aqui tratam, e os três vivem no seu repositório, não no do seu fornecedor.
- Coloque as diferenças de precisão nas coordenadas certas. “83.6% vs 99.7%” é um especialista em casa; “0.815 vs 0.927” é um modelo pequeno rodando na CPU que só responde sim/não. Diga as duas metades, ou a tabela engana.
O tamanho do ecossistema
A pegada pública do ecossistema é de aproximadamente 1,100 projetos (setembro de 2026).
Volume não é qualidade, e não é maturidade. Essa contagem inclui
uma grande quantidade de projetos de um único commit compartilhando um mesmo andaime: um autor lançando um lote
de repositórios no mesmo dia, compartilhando um AGENTS.md, um histórico de um único commit e
consideravelmente mais prosa do que código. Eles podem ser inteiramente legítimos — são simplesmente
não comprovados. Filtre por “há algo executável”, não por “apareceu numa lista”.
Em uma frase
A camada de modelos está se tornando um consumível; a interface, os limiares e a calibração não. Gaste seu esforço nos três últimos — o primeiro é substituível a qualquer momento.