Guia prático do modelo de decisão
Estas páginas respondem a três perguntas:
- Como é que as pessoas o usam na prática em projetos reais?
- Que práticas se repetem, e quais delas só existem porque alguém se queimou com elas?
- O que dizem as provas sobre a parte que a documentação não consegue resolver — sobretudo, se é possível confiar nas probabilidades?
Cada número nas páginas seguintes vem de um registo em primeira mão verificável em público: um recálculo independente, uma experiência pré-registada ou um artefacto que o próprio projeto publicou. Em cada página diz-se qual deles é — porque esses três tipos têm um peso muito diferente.
O fio condutor
O Jev e o Laya têm uma propriedade que é simultaneamente fácil de entender e fácil de vender em
excesso: a forma da saída está garantida. Pede um Choice e recebes uma das opções mais uma
probabilidade; pede um Noul e recebes um número entre 0 e 1. Não há texto para analisar, por
isso também não existe aquilo de «o modelo divagou e o programa foi abaixo».
Mas isso é segurança de tipos, não probabilidade calibrada. O segundo é uma afirmação diferente, e hoje discute-se em público:
- Um recálculo independente descobriu que a
confidencedevolvida para perguntas deScoreé frequentemente apenas a parte fracionária da pontuação (121 saídas desse tipo, muito agrupadas) — o que parece um artefacto do formato de transmissão e não uma probabilidade calibrada. - Uma experiência pública pediu ao Jev que adivinhasse um dado justo 400 vezes. Escolheu a mesma face nas 400 vezes, com uma probabilidade média auto-reportada de 82.9%; a taxa de acerto real foi de 19.0%.
- Um teste independente de calibração fora da distribuição reportou o sinal do erro:
ChoiceeScoresão sistematicamente demasiado confiantes,Booleansistematicamente pouco confiante.
Por isso todas as páginas seguintes voltam sempre à mesma frase: trata a confiança como um prior que tens de calibrar, não como uma garantia. Cada página seguinte é sobre o que isso significa num contexto concreto.
Como ler os números
Os números seguintes vêm de três tipos de fonte, e as páginas tentam dizer qual:
| Fonte | O que significa | Como usá-la |
|---|---|---|
| Auto-reportado | O resultado do próprio autor, no seu README ou blogue | Uma pista, não uma conclusão |
| Recalculado de forma independente | Um terceiro repetiu-o, ou publicou algo que podes repetir | Citável, mas verifica na mesma a dimensão da amostra |
| Pré-registado | Critérios fixados antes da execução, resultados publicados de qualquer forma | O tipo mais informativo |
A distinção não é pedantismo. O mesmo modelo aparece tanto em resultados auto-reportados de «supera o Jev» como num resultado negativo independente — ambos são verdadeiros, e a diferença está em quem mediu, e quanto.