Glossário de modelos de decisão
Na documentação original, esses termos estão em inglês. Este site fixa uma tradução para cada um e mantém o original em inglês ao lado.
- System Onemodelo System One
Uma classe de modelos treinados para tomar decisões rápidas e estruturadas que o software pode consumir diretamente. A diferença principal em relação aos LLMs generativos é que eles não produzem texto — então não há nada para analisar nem margem para alucinações. A saída são valores tipados e distribuições de probabilidade com as quais você pode ramificar, ordenar e rotear no seu código.
- stateestado
O material que um modelo System One avalia: um e-mail, um ticket, um documento JSON, um trecho de texto de contrato. Todas as perguntas de uma requisição são avaliadas contra o mesmo estado, de forma independente. Uma consequência prática: adicionar perguntas quase não altera a latência, e mais perguntas não degradam o contexto.
- questionpergunta (primitiva)
Uma pergunta tipada feita ao estado. Existem exatamente três: choice, score e noul. Elas são chamadas de primitivas por analogia com as primitivas de software — modulares, componíveis e estruturadas. Você pode misturar as três e fazer várias de uma vez em uma única requisição.
- choicechoice (escolha)
Escolha uma opção de um conjunto definido. O Choice da Jev aceita até 255 opções. Junto com o item selecionado, você recebe uma probabilidade para cada opção e uma confiança geral. Bom para classificação, roteamento e para escolher um candidato entre vários.
- scorescore (pontuação)
Coloque o estado numa escala ordenada e descrita. A resposta é um score, uma probabilidade para cada nível e a confiança. A diferença em relação ao choice é que os níveis são ordenados. Um erro comum é fazer uma única pergunta composta — decomponha em vários scores atômicos e combine-os com pesos que você controla no código.
- noulnoul (juízo de sim ou não)
Faça uma pergunta de sim ou não e receba a probabilidade de a resposta ser sim (0–1). Não é a mesma coisa que a confiança: um noul é uma probabilidade sobre o mundo, e a confiança é o quanto o modelo considera confiável o próprio julgamento.
- confidenceconfiança (confidence)
O quão certo o modelo está do próprio julgamento. Esta é a saída mais útil: a resposta diz o que, e a confiança diz se você deve agir com base nela. O uso típico é o gating — aplicar automaticamente acima de um limiar e encaminhar para uma pessoa abaixo dele. Observe que nem todo tipo de pergunta a retorna: choice e score sim; noul não, porque ele próprio é uma probabilidade.
- calibrationcalibração
Se as probabilidades significam o que dizem: entre as amostras que o modelo chama de 70%, cerca de 70% deveriam ser realmente positivas. Os dois modelos treinam isso com aprendizado por reforço contra regras de pontuação estritamente próprias (a Jev chama de RLCD), e é a precondição para usar a confiança como limiar. Uma confiança não calibrada é apenas um número.
⚠️ Treinar com um objetivo de calibração não é a mesma coisa que entregar probabilidades calibradas. Há evidências públicas em contrário: um experimento independente pediu que a Jev adivinhasse um dado justo 400 vezes e ela escolheu a mesma face todas as vezes, com uma média autorrelatada de 82.9% contra uma taxa de acerto real de 19.0%; um teste pré-registrado fora da distribuição encontrou direções de viés opostas por primitiva. Em produção, trate a confiança como um prior a ser calibrado e meça a faixa confiável nos seus próprios dados — consulte as medições e a seleção de limiar no guia.
- escalationescalonamento (passar para uma pessoa)
Entregar uma decisão a uma pessoa quando a confiança cai na faixa intermediária. É um nível projetado, não um ramo de falha: aplicar automaticamente acima, descartar abaixo e escalonar a faixa intermediária. Duas coisas passam fácil despercebidas: a faixa é um custo humano (faixa mais larga, mais trabalho humano), e o escalonamento precisa de um fail-safe — sem ele, um item não reclamado fica ali para sempre enquanto o painel parece exatamente com "tudo certo".
fast-jev-compaction6,653★ · foreman540★ →
- cascadecascata
Deixe o nível barato decidir primeiro e envie apenas o que ele não tem certeza ao modelo mais caro. A economia equivale à fatia do tráfego dentro da região de alta confiança — numa medição, 37% dos casos foram resolvidos com ≥90% de confiança e 37% das chamadas ao modelo grande foram eliminadas —, não a uma porcentagem fixa. Ela pressupõe que o modelo menor erra como ruído aleatório; se for sistematicamente confiante demais numa classe de entrada, essa classe nunca é escalonada.
jev-review (devagrawal09)586★ · jev-search446★ →
- fan-out
Faça muitas perguntas numa única requisição e deixe o seu código ficar com as respostas úteis. O que você economiza é sobretudo entrada: o mesmo estado é enviado uma vez, então quanto mais perguntas, mais se dilui o custo fixo por requisição (numa medição: economia mediana de 76–86% em tokens de entrada com 8 perguntas em paralelo). ⚠️ Serve para julgamentos independentes — classificação, pontuação, filtragem — e não para ranking, que exige comparar os itens entre si: um benchmark descobriu que o caminho em lote não passava no seu portão de qualidade de ordenação.
jev-review (devagrawal09)586★ · jev-search446★ →
- guardrailguardrail (salvaguarda)
Um único julgamento estruturado, aplicado antes de o conteúdo entrar ou sair de um sistema, que decide liberar / revisar / bloquear / redirecionar. O trade-off principal não é o limiar, mas para que lado ele pende quando há um erro: guardrails de risco (permissões, segredos, ações perigosas) devem ser fail-closed, e guardrails de rendimento (verificações de conclusão e de formato) devem ser fail-open. Outra prática recorrente é executar primeiro as regras determinísticas e dar ao modelo apenas a zona cinzenta que as regras não conseguem decidir.
fast-jev-compaction6,653★ · foreman540★ →
- abstentionabstenção
O mecanismo que um modelo usa para marcar as respostas das quais não tem certeza, sem descartá-las. Dê a uma requisição um limiar
min_confidencee qualquer resposta abaixo dele volta marcada comolow_confidence— a resposta em si continua sendo devolvida, e quem chama decide o que fazer. A porta relata um de três estados:passed,abstainedouunevaluated(a resposta não trazia confiança utilizável, então a porta não conseguiu decidir). Sem limiar definido, nenhuma das chaves aparece: a ausência é o relato, não um quarto estado.- local deploymentimplantação local
A prática de rodar modelos de decisão abertos na sua própria máquina — o Ollaya é uma forma pronta de fazer isso. As marcas: os pesos ficam no disco local, o serviço escuta num endereço de loopback como
127.0.0.1:11435, nada é cobrado por chamada e seus dados permanecem dentro do seu próprio ambiente. Implantação e modelo são duas camadas: uma mesma implantação pode servir muitos modelos, e a precisão que você obtém é a do modelo, não a da implantação.