Glossário de modelos de decisão

Na documentação original, estes termos estão em inglês. Este site fixa uma tradução para cada um e mantém o original em inglês ao lado.

System Onemodelo System One

Uma classe de modelos treinados para tomar decisões rápidas e estruturadas que o software pode consumir diretamente. A principal diferença em relação aos LLM generativos é que não produzem texto — por isso não há nada para analisar nem margem para alucinações. O resultado são valores tipados e distribuições de probabilidade sobre os quais o teu código pode ramificar, ordenar e encaminhar.

See also state · question

Original System One

stateestado

O material que um modelo System One avalia: um e-mail, um ticket, um documento JSON, um trecho de texto de contrato. Cada pergunta de um pedido é avaliada de forma independente em relação ao mesmo estado. Uma consequência prática: acrescentar perguntas quase não altera a latência, e mais perguntas não degradam o contexto.

See also question · choice

Original Estado

questionpergunta (primitiva)

Uma pergunta tipada feita ao estado. Existem exatamente três: choice, score e noul. Chamam-se primitivas por analogia com as primitivas de software — modulares, componíveis e estruturadas. Podes misturar as três e fazer várias de uma vez num único pedido.

See also choice · score · noul

Original Primitivas (perguntas)

choicechoice (escolha)

Escolhe uma opção de um conjunto definido. O Choice da Jev aceita até 255 opções. A par do item selecionado, recebes uma probabilidade para cada opção e uma confiança global. Bom para classificação, encaminhamento e para escolher um candidato entre vários.

See also score · noul · confidence

Original Choice

scorescore (pontuação)

Coloca o estado numa escala ordenada e descrita. A resposta é um score, uma probabilidade para cada nível e a confiança. A diferença em relação ao choice é que os níveis estão ordenados. Um erro comum é fazer uma única pergunta composta — decompõe em vários scores atómicos e combina-os com pesos que controlas no código.

See also choice · noul · confidence

Original Score

noulnoul (juízo de sim ou não)

Faz uma pergunta de sim ou não e recebe a probabilidade de a resposta ser sim (0–1). Não é a mesma coisa que a confiança: um noul é uma probabilidade sobre o mundo, e a confiança é o quão fiável o modelo considera o seu próprio julgamento.

See also confidence · choice

Original Noul

confidenceconfiança (confidence)

O quão certo o modelo está do seu próprio julgamento. Esta é a saída mais útil: a resposta diz o que, e a confiança diz se deves agir com base nela. O uso típico é o gating — aplicar automaticamente acima de um limiar e encaminhar para uma pessoa abaixo dele. Nota que nem todos os tipos de pergunta a devolvem: choice e score sim; noul não, porque é ele próprio uma probabilidade.

See also noul · score

Original Confiança

calibrationcalibração

Se as probabilidades querem dizer o que dizem: entre as amostras que o modelo indica como 70%, cerca de 70% deveriam ser realmente positivas. Os dois modelos treinam isto com aprendizagem por reforço contra regras de pontuação estritamente próprias (a Jev chama-lhe RLCD), e é a precondição para usar a confiança como limiar. Uma confiança não calibrada é apenas um número.

⚠️ Treinar com um objetivo de calibração não é a mesma coisa que entregar probabilidades calibradas. Há provas públicas em contrário: uma experiência independente pediu à Jev que adivinhasse um dado justo 400 vezes e escolheu sempre a mesma face, com uma média auto-relatada de 82.9% contra uma taxa de acerto real de 19.0%; um teste pré-registado fora da distribuição encontrou direções de enviesamento opostas por primitiva. Em produção, trata a confiança como um a priori a calibrar e mede a faixa fiável nos teus próprios dados — vê as medições e a seleção do limiar no guia.

Projetos SemIf4,162★ · NanoJev2,159★ →

See also confidence · noul

Original Confiança

escalationescalonamento (passar para uma pessoa)

Entregar uma decisão a uma pessoa quando a confiança cai na faixa intermédia. É um nível concebido, não um ramo de falha: aplicar automaticamente acima, descartar abaixo e escalonar a faixa intermédia. Duas coisas passam facilmente despercebidas: a faixa é um custo humano (faixa mais larga, mais trabalho humano), e o escalonamento precisa de um fail-safe — sem ele, um item não reclamado fica ali para sempre enquanto o painel se parece exatamente com «tudo bem».

Projetos fast-jev-compaction6,653★ · foreman540★ →

See also confidence · calibration

Original Encaminhamento com gating por confiança

cascadecascata

Deixa o nível barato decidir primeiro e envia apenas o que ele não tem a certeza ao modelo mais caro. A poupança equivale à fatia do tráfego dentro da região de alta confiança — numa medição, 37% dos casos foram resolvidos com ≥90% de confiança e 37% das chamadas ao modelo grande foram eliminadas —, não a uma percentagem fixa. Pressupõe que o modelo mais pequeno erra como ruído aleatório; se for sistematicamente demasiado confiante numa classe de entrada, essa classe nunca é escalonada.

Projetos jev-review (devagrawal09)586★ · jev-search446★ →

See also escalation · fan-out

Original Cascata SDE

fan-out

Faz muitas perguntas num único pedido e deixa o teu código ficar com as respostas úteis. O que poupas é sobretudo entrada: o mesmo estado é enviado uma só vez, por isso quanto mais perguntas, mais se dilui o custo fixo por pedido (numa medição: poupança mediana de 76–86% em tokens de entrada com 8 perguntas em paralelo). ⚠️ Serve para julgamentos independentes — classificação, pontuação, filtragem — e não para ranking, que exige comparar os itens entre si: um benchmark concluiu que o caminho em lote não passava no seu limiar de qualidade de ordenação.

Projetos jev-review (devagrawal09)586★ · jev-search446★ →

See also cascade · question

Original Fan-out especulativo

guardrailguardrail (salvaguarda)

Um único julgamento estruturado, aplicado antes de o conteúdo entrar ou sair de um sistema, que decide deixar passar / rever / bloquear / reencaminhar. O trade-off principal não é o limiar, mas para que lado pende quando há um erro: guardrails de risco (permissões, segredos, ações perigosas) devem ser fail-closed, e guardrails de débito (verificações de conclusão e de formato) devem ser fail-open. Outra prática recorrente é executar primeiro as regras determinísticas e dar ao modelo apenas a zona cinzenta que as regras não conseguem decidir.

Projetos fast-jev-compaction6,653★ · foreman540★ →

See also escalation · noul

Original Guardrails para LLMs

abstentionabstenção

O mecanismo que um modelo usa para marcar as respostas de que não tem a certeza, sem as descartar. Dá a um pedido um limiar min_confidence e qualquer resposta abaixo dele volta marcada como low_confidence — a resposta em si continua a ser devolvida, e quem chama decide o que fazer. A porta relata um de três estados: passed, abstained ou unevaluated (a resposta não trazia confiança utilizável, por isso a porta não conseguiu decidir). Sem limiar definido, nenhuma das chaves aparece: a ausência é o relato, não um quarto estado.

See also confidence · calibration · guardrail

Original API HTTP

local deploymentimplementação local

A prática de correr modelos de decisão abertos na tua própria máquina — o Ollaya é uma forma pronta de o fazer. Os sinais: os pesos ficam no disco local, o serviço escuta num endereço de loopback como 127.0.0.1:11435, não se cobra nada por chamada e os teus dados ficam dentro do teu próprio ambiente. Implementação e modelo são duas camadas: uma mesma implementação pode servir muitos modelos, e a precisão que obténs é a do modelo, não a da implementação.

See also System One

Original Ollaya · Quickstart