Guia prático do modelo de decisão
Estas páginas respondem a três perguntas:
- Como as pessoas realmente o usam em projetos reais?
- Quais práticas continuam aparecendo, e quais delas só existem porque alguém se queimou?
- O que a evidência diz sobre a parte que a documentação não resolve — sobretudo, se é possível confiar nas probabilidades?
Cada número nas páginas abaixo vem de um registro em primeira mão verificável publicamente: uma recomputação independente, um experimento preregistrado ou um artefato que o próprio projeto publicou. A página diz de qual tipo se trata — porque esses três carregam pesos muito diferentes.
O fio condutor
Jev e Laya têm uma propriedade que é ao mesmo tempo fácil de entender e fácil de exagerar:
a forma da saída é garantida. Peça um Choice e você recebe de volta uma das
opções mais uma probabilidade; peça um Noul e você recebe um número entre 0 e 1.
Não há texto para analisar, então não existe “o modelo divagou e o programa quebrou”.
Mas isso é segurança de tipos, não probabilidade calibrada. A segunda é uma afirmação diferente, e atualmente está contestada em público:
- Uma recomputação independente descobriu que a
confidenceretornada para perguntasScoreé frequentemente apenas a parte fracionária do score (121 dessas saídas, fortemente agrupadas) — o que parece um artefato do formato de transmissão, e não uma probabilidade calibrada. - Um experimento público pediu que a Jev adivinhasse um dado justo 400 vezes. Ela escolheu a mesma face nas 400 vezes, com probabilidade média autorrelatada de 82.9%; a taxa de acerto real foi de 19.0%.
- Um teste independente de calibração fora da distribuição relatou o sinal do erro:
ChoiceeScoresão sistematicamente superconfiantes,Booleansistematicamente subconfiante.
Então cada página abaixo volta a uma mesma frase: trate a confiança como uma prior que você precisa calibrar, não como uma garantia. Cada página abaixo trata do que isso significa num contexto específico.
Como ler os números
Os números abaixo vêm de três tipos de fonte, e as páginas tentam dizer qual:
| Fonte | O que significa | Como usá-la |
|---|---|---|
| Autorrelatado | Resultado do próprio autor, no README ou no blog dele | Uma pista, não uma conclusão |
| Recomputado de forma independente | Um terceiro executou de novo, ou publicou algo que você pode executar | Citável, mas ainda verifique o tamanho da amostra |
| Preregistrado | Critérios fixados antes da execução, resultados publicados de qualquer forma | O tipo mais informativo |
A distinção não é pedantismo. O mesmo modelo aparece tanto em resultados autorrelatados de “supera a Jev” quanto num resultado negativo independente — ambos são verdadeiros, e a diferença é quem mediu, e quanto.