Documentação

Críticas públicas e resultados que não se reproduziram

A página anterior tratou de como corrigir a calibração. Esta página trata de por que ela precisa de correção — reunindo as evidências públicas contrárias, porque elas raramente chegam à página inicial de um projeto.

A forma certa de ler esta página não é “então o modelo é ruim”, mas: estes são modos de falha conhecidos, e o seu sistema precisa sobreviver a eles.

O experimento com o dado

O mais direto. Peça ao modelo que adivinhe um dado justo, 400 vezes:

Item Resultado
Qual face ele escolheu a mesma face nas 400 vezes
Probabilidade média autorrelatada 82.9%
Taxa de acerto real 19.0%

Esses números dizem duas coisas ao mesmo tempo. Primeiro, uma probabilidade autorrelatada pode não carregar informação nenhuma — 82.9% não lhe disse nada confiável sobre uma tarefa com 19% de taxa de acerto. Segundo, o modelo não expressa “não sei”. Num dado justo, a resposta correta é “cerca de 16.7% para cada face”, e a forma da saída — uma opção preferida com probabilidade alta — não tem como dizer isso.

Outro resultado do mesmo autor vale guardar: num documento sintético de previsão, um risco de escassez de 30% virou 5.3% através de Choice e 26.7% através de Noul. Mesma entrada, mesmo significado, primitiva diferente — uma diferença de cinco vezes. A escolha da primitiva muda a resposta, e há evidência mais forte disso na página de avaliação.

“Jev Can’t Be Calibrated”

Uma crítica amplamente divulgada argumenta, no nível estatístico, que a afirmação sobre calibração não se sustenta nas evidências disponíveis. Uma discussão bastante votada coloca o mesmo ponto com mais cuidado:

A garantia de segurança de tipos é real (verificada de várias direções), mas a afirmação sobre calibração não tem nenhum ECE ou curva de confiabilidade publicado por trás.

Observe a precisão: não diz que a calibração é falsa, diz que falta a evidência pública que a sustenta. São afirmações diferentes, e para uma decisão de engenharia elas levam ao mesmo lugar — você não pode definir um limiar de produção sobre algo sem nenhuma curva de confiabilidade publicada.

Reranking: um resultado negativo completo

Essa classe de resultado é a mais valiosa, porque é específica, reproduzível e nega exatamente a implicação de que “pode fazer qualquer coisa”.

Uma avaliação de reranking usou 33,047 itens, 164 consultas reais e 9,831 pares julgados, e concluiu que o reranking puro por modelo de decisão perde para a recuperação vetorial.

A escala é o ponto: trinta e poucos mil itens e mais de cem consultas reais não é um cenário de brinquedo. E o caso de uso que ela nega — o reranking semântico — é exatamente o que mais provavelmente se presume que venha de graça da classificação.

Uma decisão dividida

Alguns resultados dependem de qual linha você lê. Uma comparação de pontuação contra geração:

Em NLI japonês, a pontuação multidimensional com pesos ajustados localmente superou perguntar diretamente (0.9076 vs 0.8373). Mas ela sinalizou cerca de 25 vezes mais linhas benignas difíceis do que ataques (37.2% vs 1.5%).

A média melhorou enquanto a taxa de falsos positivos de uma classe subiu 25×. Se sinalizar entrada benigna é caro no seu sistema, essa melhoria é negativa para você — mesmo parecendo positiva.

Há também um experimento preregistrado (critérios fixados antes da execução, resultados publicados de qualquer forma) que produziu veredictos inconsistentes entre conjuntos de dados — passando em um, falhando em outro.

A própria documentação do fornecedor admite isso

A página oficial sobre “jaggedness do modelo” lista modos de falha conhecidos da versão pública atual. Isso não é evidência contrária, mas sua existência diz algo: “este modelo tem desempenho ruim em algumas tarefas” faz parte da posição oficial, não é segredo.

Transformando esta página em regras

Três regras de engenharia saem daí:

  1. Nunca raciocine entre tarefas a partir do valor absoluto de uma confiança. “0.9 significa 90% correto” é simplesmente falso numa tarefa como a do dado.
  2. A escolha da primitiva é uma variável experimental, não uma escolha de estilo. A mesma pergunta feita como Choice ou como Noul pode diferir cinco vezes. Meça essa diferença em vez de escolher uma arbitrariamente.
  3. Olhe as subclasses, não os totais. O exemplo de 25× de falsos positivos é completamente invisível no agregado.

Em uma frase

Nada disso é razão para não usar estes modelos — é razão para não confiar nos padrões. Todo padrão em outras partes deste guia (o código é dono do limiar, gating, abstenção conformal) é uma forma de trabalhar dentro das restrições desta página.