Documentação

Críticas públicas e resultados que não se reproduziram

A página anterior tratou de como corrigir a calibração. Esta trata de porque é que ela precisa de ser corrigida — reunindo as provas públicas em contrário, porque raramente chegam à página inicial de um projeto.

A forma certa de ler esta página não é «então o modelo é mau», mas: estes são modos de falha conhecidos, e o teu sistema tem de sobreviver a eles.

A experiência do dado

A mais direta. Pede ao modelo que adivinhe um dado justo, 400 vezes:

Item Resultado
Que face escolheu a mesma face nas 400 vezes
Probabilidade média auto-reportada 82.9%
Taxa de acerto real 19.0%

Estes números dizem duas coisas ao mesmo tempo. Primeiro, uma probabilidade auto-reportada pode não conter informação nenhuma — 82.9% não te disse nada de fiável sobre uma tarefa com uma taxa de acerto de 19%. Segundo, o modelo não exprime «não sei». Num dado justo a resposta correta é «cerca de 16.7% cada», e a forma da saída — uma opção preferida com uma probabilidade alta — não tem maneira de dizer isso.

Outro resultado do mesmo autor merece ser guardado: num documento de previsão sintético, um risco de rutura de 30% passou a 5.3% através de Choice e a 26.7% através de Noul. Mesma entrada, mesmo significado, primitiva diferente — uma diferença de cinco vezes. A escolha da primitiva muda a resposta, e há provas mais fortes disso na página de avaliação.

«Jev Can’t Be Calibrated»

Uma crítica amplamente divulgada argumenta, ao nível estatístico, que a afirmação sobre a calibração não se sustenta nas provas disponíveis. Uma discussão muito votada coloca o mesmo ponto com mais cuidado:

A garantia de segurança de tipos é real (verificada a partir de várias direções), mas a afirmação sobre a calibração não tem por trás nenhum ECE nem curva de fiabilidade publicados.

Repara na precisão: não diz que a calibração é falsa, diz que faltam as provas públicas que a sustentam. São afirmações diferentes, e para uma decisão de engenharia levam ao mesmo sítio — não podes fixar um limiar de produção para algo sem curva de fiabilidade publicada.

Reranking: um resultado negativo completo

Esta classe de resultado é a mais valiosa, porque é específica, reproduzível e nega exatamente a implicação de «consegue fazer tudo».

Uma avaliação de reranking usou 33,047 itens, 164 consultas reais e 9,831 pares julgados e concluiu que o reranking puro com um modelo de decisão perde para a recuperação por vetores.

A escala é o ponto: trinta e tantos mil itens e mais de uma centena de consultas reais não é um contexto de brinquedo. E o caso de uso que nega — o reranking semântico — é exatamente aquele que é mais provável de se assumir que segue de graça a partir da classificação.

Uma decisão dividida

Alguns resultados dependem da linha que lês. Uma comparação entre pontuação e geração:

Em NLI japonês, a pontuação multidimensional com pesos ajustados localmente bateu o perguntar diretamente (0.9076 vs 0.8373). Mas sinalizou cerca de 25 vezes mais linhas benignas difíceis do que ataques (37.2% vs 1.5%).

A média melhorou enquanto a taxa de falsos positivos de uma classe subiu 25×. Se a sinalização errada de entrada benigna for cara no teu sistema, esta melhoria é negativa para ti — mesmo que pareça positiva.

Há também uma experiência pré-registada (critérios fixados antes da execução, resultados publicados de qualquer forma) que produziu veredictos inconsistentes entre conjuntos de dados — passando num, falhando noutro.

A própria documentação do fornecedor admite isto

A página oficial sobre a «irregularidade do modelo» lista modos de falha conhecidos da versão pública atual. Isso não são provas em contrário, mas a sua existência diz algo: «este modelo tem um desempenho mau em algumas tarefas» faz parte da posição oficial, não é segredo.

Transformar esta página em regras

Saem daqui três regras de engenharia:

  1. Nunca raciocines entre tarefas a partir do valor absoluto de uma confiança. «0.9 significa 90% de acerto» é simplesmente falso numa tarefa como a do dado.
  2. A escolha da primitiva é uma variável experimental, não uma escolha de estilo. A mesma pergunta feita como Choice ou como Noul pode diferir cinco vezes. Mede essa diferença em vez de escolher uma arbitrariamente.
  3. Olha para as subclasses, não para os totais. O exemplo dos 25× de falsos positivos é completamente invisível no agregado.

Numa frase

Nada disto é razão para não usar estes modelos — é razão para não confiar nos valores predefinidos. Todos os padrões deste guia (o código é dono do limiar, o gating, a abstenção conformal) são formas de trabalhar dentro das restrições desta página.