Críticas públicas e resultados que não se reproduziram
A página anterior tratou de como corrigir a calibração. Esta página trata de por que ela precisa de correção — reunindo as evidências públicas contrárias, porque elas raramente chegam à página inicial de um projeto.
A forma certa de ler esta página não é “então o modelo é ruim”, mas: estes são modos de falha conhecidos, e o seu sistema precisa sobreviver a eles.
O experimento com o dado
O mais direto. Peça ao modelo que adivinhe um dado justo, 400 vezes:
| Item | Resultado |
|---|---|
| Qual face ele escolheu | a mesma face nas 400 vezes |
| Probabilidade média autorrelatada | 82.9% |
| Taxa de acerto real | 19.0% |
Esses números dizem duas coisas ao mesmo tempo. Primeiro, uma probabilidade autorrelatada pode não carregar informação nenhuma — 82.9% não lhe disse nada confiável sobre uma tarefa com 19% de taxa de acerto. Segundo, o modelo não expressa “não sei”. Num dado justo, a resposta correta é “cerca de 16.7% para cada face”, e a forma da saída — uma opção preferida com probabilidade alta — não tem como dizer isso.
Outro resultado do mesmo autor vale guardar: num documento sintético de previsão,
um risco de escassez de 30% virou 5.3% através de Choice e 26.7% através de Noul. Mesma entrada,
mesmo significado, primitiva diferente — uma diferença de cinco vezes. A escolha da primitiva
muda a resposta, e há evidência mais forte disso na
página de avaliação.
“Jev Can’t Be Calibrated”
Uma crítica amplamente divulgada argumenta, no nível estatístico, que a afirmação sobre calibração não se sustenta nas evidências disponíveis. Uma discussão bastante votada coloca o mesmo ponto com mais cuidado:
A garantia de segurança de tipos é real (verificada de várias direções), mas a afirmação sobre calibração não tem nenhum ECE ou curva de confiabilidade publicado por trás.
Observe a precisão: não diz que a calibração é falsa, diz que falta a evidência pública que a sustenta. São afirmações diferentes, e para uma decisão de engenharia elas levam ao mesmo lugar — você não pode definir um limiar de produção sobre algo sem nenhuma curva de confiabilidade publicada.
Reranking: um resultado negativo completo
Essa classe de resultado é a mais valiosa, porque é específica, reproduzível e nega exatamente a implicação de que “pode fazer qualquer coisa”.
Uma avaliação de reranking usou 33,047 itens, 164 consultas reais e 9,831 pares julgados, e concluiu que o reranking puro por modelo de decisão perde para a recuperação vetorial.
A escala é o ponto: trinta e poucos mil itens e mais de cem consultas reais não é um cenário de brinquedo. E o caso de uso que ela nega — o reranking semântico — é exatamente o que mais provavelmente se presume que venha de graça da classificação.
Uma decisão dividida
Alguns resultados dependem de qual linha você lê. Uma comparação de pontuação contra geração:
Em NLI japonês, a pontuação multidimensional com pesos ajustados localmente superou perguntar diretamente (0.9076 vs 0.8373). Mas ela sinalizou cerca de 25 vezes mais linhas benignas difíceis do que ataques (37.2% vs 1.5%).
A média melhorou enquanto a taxa de falsos positivos de uma classe subiu 25×. Se sinalizar entrada benigna é caro no seu sistema, essa melhoria é negativa para você — mesmo parecendo positiva.
Há também um experimento preregistrado (critérios fixados antes da execução, resultados publicados de qualquer forma) que produziu veredictos inconsistentes entre conjuntos de dados — passando em um, falhando em outro.
A própria documentação do fornecedor admite isso
A página oficial sobre “jaggedness do modelo” lista modos de falha conhecidos da versão pública atual. Isso não é evidência contrária, mas sua existência diz algo: “este modelo tem desempenho ruim em algumas tarefas” faz parte da posição oficial, não é segredo.
Transformando esta página em regras
Três regras de engenharia saem daí:
- Nunca raciocine entre tarefas a partir do valor absoluto de uma confiança. “0.9 significa 90% correto” é simplesmente falso numa tarefa como a do dado.
- A escolha da primitiva é uma variável experimental, não uma escolha de estilo. A mesma
pergunta feita como
Choiceou comoNoulpode diferir cinco vezes. Meça essa diferença em vez de escolher uma arbitrariamente. - Olhe as subclasses, não os totais. O exemplo de 25× de falsos positivos é completamente invisível no agregado.
Em uma frase
Nada disso é razão para não usar estes modelos — é razão para não confiar nos padrões. Todo padrão em outras partes deste guia (o código é dono do limiar, gating, abstenção conformal) é uma forma de trabalhar dentro das restrições desta página.