Glossário de modelos de decisão
Na documentação original, estes termos estão em inglês. Este site fixa uma tradução para cada um e mantém o original em inglês ao lado.
- System Onemodelo System One
Uma classe de modelos treinados para tomar decisões rápidas e estruturadas que o software pode consumir diretamente. A principal diferença em relação aos LLM generativos é que não produzem texto — por isso não há nada para analisar nem margem para alucinações. O resultado são valores tipados e distribuições de probabilidade sobre os quais o teu código pode ramificar, ordenar e encaminhar.
- stateestado
O material que um modelo System One avalia: um e-mail, um ticket, um documento JSON, um trecho de texto de contrato. Cada pergunta de um pedido é avaliada de forma independente em relação ao mesmo estado. Uma consequência prática: acrescentar perguntas quase não altera a latência, e mais perguntas não degradam o contexto.
- questionpergunta (primitiva)
Uma pergunta tipada feita ao estado. Existem exatamente três: choice, score e noul. Chamam-se primitivas por analogia com as primitivas de software — modulares, componíveis e estruturadas. Podes misturar as três e fazer várias de uma vez num único pedido.
- choicechoice (escolha)
Escolhe uma opção de um conjunto definido. O Choice da Jev aceita até 255 opções. A par do item selecionado, recebes uma probabilidade para cada opção e uma confiança global. Bom para classificação, encaminhamento e para escolher um candidato entre vários.
- scorescore (pontuação)
Coloca o estado numa escala ordenada e descrita. A resposta é um score, uma probabilidade para cada nível e a confiança. A diferença em relação ao choice é que os níveis estão ordenados. Um erro comum é fazer uma única pergunta composta — decompõe em vários scores atómicos e combina-os com pesos que controlas no código.
- noulnoul (juízo de sim ou não)
Faz uma pergunta de sim ou não e recebe a probabilidade de a resposta ser sim (0–1). Não é a mesma coisa que a confiança: um noul é uma probabilidade sobre o mundo, e a confiança é o quão fiável o modelo considera o seu próprio julgamento.
- confidenceconfiança (confidence)
O quão certo o modelo está do seu próprio julgamento. Esta é a saída mais útil: a resposta diz o que, e a confiança diz se deves agir com base nela. O uso típico é o gating — aplicar automaticamente acima de um limiar e encaminhar para uma pessoa abaixo dele. Nota que nem todos os tipos de pergunta a devolvem: choice e score sim; noul não, porque é ele próprio uma probabilidade.
- calibrationcalibração
Se as probabilidades querem dizer o que dizem: entre as amostras que o modelo indica como 70%, cerca de 70% deveriam ser realmente positivas. Os dois modelos treinam isto com aprendizagem por reforço contra regras de pontuação estritamente próprias (a Jev chama-lhe RLCD), e é a precondição para usar a confiança como limiar. Uma confiança não calibrada é apenas um número.
⚠️ Treinar com um objetivo de calibração não é a mesma coisa que entregar probabilidades calibradas. Há provas públicas em contrário: uma experiência independente pediu à Jev que adivinhasse um dado justo 400 vezes e escolheu sempre a mesma face, com uma média auto-relatada de 82.9% contra uma taxa de acerto real de 19.0%; um teste pré-registado fora da distribuição encontrou direções de enviesamento opostas por primitiva. Em produção, trata a confiança como um a priori a calibrar e mede a faixa fiável nos teus próprios dados — vê as medições e a seleção do limiar no guia.
- escalationescalonamento (passar para uma pessoa)
Entregar uma decisão a uma pessoa quando a confiança cai na faixa intermédia. É um nível concebido, não um ramo de falha: aplicar automaticamente acima, descartar abaixo e escalonar a faixa intermédia. Duas coisas passam facilmente despercebidas: a faixa é um custo humano (faixa mais larga, mais trabalho humano), e o escalonamento precisa de um fail-safe — sem ele, um item não reclamado fica ali para sempre enquanto o painel se parece exatamente com «tudo bem».
fast-jev-compaction6,653★ · foreman540★ →
- cascadecascata
Deixa o nível barato decidir primeiro e envia apenas o que ele não tem a certeza ao modelo mais caro. A poupança equivale à fatia do tráfego dentro da região de alta confiança — numa medição, 37% dos casos foram resolvidos com ≥90% de confiança e 37% das chamadas ao modelo grande foram eliminadas —, não a uma percentagem fixa. Pressupõe que o modelo mais pequeno erra como ruído aleatório; se for sistematicamente demasiado confiante numa classe de entrada, essa classe nunca é escalonada.
jev-review (devagrawal09)586★ · jev-search446★ →
- fan-out
Faz muitas perguntas num único pedido e deixa o teu código ficar com as respostas úteis. O que poupas é sobretudo entrada: o mesmo estado é enviado uma só vez, por isso quanto mais perguntas, mais se dilui o custo fixo por pedido (numa medição: poupança mediana de 76–86% em tokens de entrada com 8 perguntas em paralelo). ⚠️ Serve para julgamentos independentes — classificação, pontuação, filtragem — e não para ranking, que exige comparar os itens entre si: um benchmark concluiu que o caminho em lote não passava no seu limiar de qualidade de ordenação.
jev-review (devagrawal09)586★ · jev-search446★ →
- guardrailguardrail (salvaguarda)
Um único julgamento estruturado, aplicado antes de o conteúdo entrar ou sair de um sistema, que decide deixar passar / rever / bloquear / reencaminhar. O trade-off principal não é o limiar, mas para que lado pende quando há um erro: guardrails de risco (permissões, segredos, ações perigosas) devem ser fail-closed, e guardrails de débito (verificações de conclusão e de formato) devem ser fail-open. Outra prática recorrente é executar primeiro as regras determinísticas e dar ao modelo apenas a zona cinzenta que as regras não conseguem decidir.
fast-jev-compaction6,653★ · foreman540★ →
- abstentionabstenção
O mecanismo que um modelo usa para marcar as respostas de que não tem a certeza, sem as descartar. Dá a um pedido um limiar
min_confidencee qualquer resposta abaixo dele volta marcada comolow_confidence— a resposta em si continua a ser devolvida, e quem chama decide o que fazer. A porta relata um de três estados:passed,abstainedouunevaluated(a resposta não trazia confiança utilizável, por isso a porta não conseguiu decidir). Sem limiar definido, nenhuma das chaves aparece: a ausência é o relato, não um quarto estado.- local deploymentimplementação local
A prática de correr modelos de decisão abertos na tua própria máquina — o Ollaya é uma forma pronta de o fazer. Os sinais: os pesos ficam no disco local, o serviço escuta num endereço de loopback como
127.0.0.1:11435, não se cobra nada por chamada e os teus dados ficam dentro do teu próprio ambiente. Implementação e modelo são duas camadas: uma mesma implementação pode servir muitos modelos, e a precisão que obténs é a do modelo, não a da implementação.