Críticas públicas e resultados que não se reproduziram
A página anterior tratou de como corrigir a calibração. Esta trata de porque é que ela precisa de ser corrigida — reunindo as provas públicas em contrário, porque raramente chegam à página inicial de um projeto.
A forma certa de ler esta página não é «então o modelo é mau», mas: estes são modos de falha conhecidos, e o teu sistema tem de sobreviver a eles.
A experiência do dado
A mais direta. Pede ao modelo que adivinhe um dado justo, 400 vezes:
| Item | Resultado |
|---|---|
| Que face escolheu | a mesma face nas 400 vezes |
| Probabilidade média auto-reportada | 82.9% |
| Taxa de acerto real | 19.0% |
Estes números dizem duas coisas ao mesmo tempo. Primeiro, uma probabilidade auto-reportada pode não conter informação nenhuma — 82.9% não te disse nada de fiável sobre uma tarefa com uma taxa de acerto de 19%. Segundo, o modelo não exprime «não sei». Num dado justo a resposta correta é «cerca de 16.7% cada», e a forma da saída — uma opção preferida com uma probabilidade alta — não tem maneira de dizer isso.
Outro resultado do mesmo autor merece ser guardado: num documento de previsão sintético, um
risco de rutura de 30% passou a 5.3% através de Choice e a 26.7% através de Noul. Mesma
entrada, mesmo significado, primitiva diferente — uma diferença de cinco vezes. A escolha da
primitiva muda a resposta, e há provas mais fortes disso na
página de avaliação.
«Jev Can’t Be Calibrated»
Uma crítica amplamente divulgada argumenta, ao nível estatístico, que a afirmação sobre a calibração não se sustenta nas provas disponíveis. Uma discussão muito votada coloca o mesmo ponto com mais cuidado:
A garantia de segurança de tipos é real (verificada a partir de várias direções), mas a afirmação sobre a calibração não tem por trás nenhum ECE nem curva de fiabilidade publicados.
Repara na precisão: não diz que a calibração é falsa, diz que faltam as provas públicas que a sustentam. São afirmações diferentes, e para uma decisão de engenharia levam ao mesmo sítio — não podes fixar um limiar de produção para algo sem curva de fiabilidade publicada.
Reranking: um resultado negativo completo
Esta classe de resultado é a mais valiosa, porque é específica, reproduzível e nega exatamente a implicação de «consegue fazer tudo».
Uma avaliação de reranking usou 33,047 itens, 164 consultas reais e 9,831 pares julgados e concluiu que o reranking puro com um modelo de decisão perde para a recuperação por vetores.
A escala é o ponto: trinta e tantos mil itens e mais de uma centena de consultas reais não é um contexto de brinquedo. E o caso de uso que nega — o reranking semântico — é exatamente aquele que é mais provável de se assumir que segue de graça a partir da classificação.
Uma decisão dividida
Alguns resultados dependem da linha que lês. Uma comparação entre pontuação e geração:
Em NLI japonês, a pontuação multidimensional com pesos ajustados localmente bateu o perguntar diretamente (0.9076 vs 0.8373). Mas sinalizou cerca de 25 vezes mais linhas benignas difíceis do que ataques (37.2% vs 1.5%).
A média melhorou enquanto a taxa de falsos positivos de uma classe subiu 25×. Se a sinalização errada de entrada benigna for cara no teu sistema, esta melhoria é negativa para ti — mesmo que pareça positiva.
Há também uma experiência pré-registada (critérios fixados antes da execução, resultados publicados de qualquer forma) que produziu veredictos inconsistentes entre conjuntos de dados — passando num, falhando noutro.
A própria documentação do fornecedor admite isto
A página oficial sobre a «irregularidade do modelo» lista modos de falha conhecidos da versão pública atual. Isso não são provas em contrário, mas a sua existência diz algo: «este modelo tem um desempenho mau em algumas tarefas» faz parte da posição oficial, não é segredo.
Transformar esta página em regras
Saem daqui três regras de engenharia:
- Nunca raciocines entre tarefas a partir do valor absoluto de uma confiança. «0.9 significa 90% de acerto» é simplesmente falso numa tarefa como a do dado.
- A escolha da primitiva é uma variável experimental, não uma escolha de estilo. A mesma
pergunta feita como
Choiceou comoNoulpode diferir cinco vezes. Mede essa diferença em vez de escolher uma arbitrariamente. - Olha para as subclasses, não para os totais. O exemplo dos 25× de falsos positivos é completamente invisível no agregado.
Numa frase
Nada disto é razão para não usar estes modelos — é razão para não confiar nos valores predefinidos. Todos os padrões deste guia (o código é dono do limiar, o gating, a abstenção conformal) são formas de trabalhar dentro das restrições desta página.