Documentação

Como avaliar um modelo de decisão

Esta página responde a uma pergunta prática: quando dois conjuntos de números discordam, em qual você acredita?

Como é uma avaliação pública

Comece pelas que um terceiro consegue executar de novo. O desenho delas é mais útil do que os números.

Opções embaralhadas, execuções repetidas. Uma avaliação com respostas publicadas e um executor de reprodução usa 108 perguntas de quatro opções, sem documentos e sem ferramentas, com 3 execuções por pergunta e ordem das opções embaralhada; o chute aleatório é 25%. Ela relata o modelo público atual em 84.6%, uma mediana de 199 ms e $0.0088, contra o modelo comparável mais forte em 98.0%, mas 2.12 s e $1.59.

⚠️ A unidade dessas duas cifras não é declarada na fonte (diz per full run) — não as transforme em um preço por chamada.

O ponto não é quem vence, é que os três eixos estão todos na mesa — 84.6% a 199 ms e 98.0% a 2.12 s são dois produtos diferentes, não um que é pior que o outro.

O embaralhamento existe para testar uma coisa específica: se o modelo é sensível à ordem das opções, ele é um componente instável em produção. Essa avaliação relata esse eixo.

A taxa base é um teto. Outro ranking independente roda PubMedQA, Banking77 e HelpSteer2 com 300 itens × 5 execuções por pergunta e publica cada probabilidade por decisão sob CC BY 4.0. Dois de seus achados importam:

  • No PubMedQA, o modelo empata em primeiro lugar e ainda custa 1/28 do valor.
  • No HelpSteer2, nenhum modelo supera a taxa base dos rótulos.

O segundo significa: nesse conjunto de dados, “sempre escolha o rótulo mais comum” é uma linha de base forte e nada a superou. Nessa situação, um primeiro lugar não prova nada — você está medindo a distribuição dos rótulos, não o modelo.

Conte saída malformada como erro. Um benchmark faz isso explicitamente. Parece pedante até você notar que isso decide se as pontuações de modelos diferentes podem ser comparadas — um modelo autorizado a emitir valores ilegais tem uma precisão sem sentido.

Comparação estatística: maior não é melhor

84.6% versus 85.1% significa que um é melhor?

Não necessariamente. Com n=100, isso está bem dentro do ruído. Um teste que já foi usado aqui é o de McNemar — ele compara os casos em que dois modelos discordam nos mesmos itens, não dois totais.

Uma réplica reproduziu respostas publicadas em 256 julgamentos e obteve 231 contra 238, McNemar p = 0.21 — nenhuma diferença significativa em relação ao modelo original. “Nenhuma diferença significativa” é uma conclusão perfeitamente respeitável, e muito mais útil do que insistir que um está mais perto.

Uma variante mais rígida é o preregistro: fixe os critérios, depois execute. Um benchmark de ranking fez exatamente isso e relatou “passa no 20 Newsgroups, falha em quatro de seis condições no Amazon ESCI”. Um resultado meio a meio como esse é mais crível do que um tudo-passou — mostra que os critérios estão realmente fazendo trabalho.

Quatro armadilhas nos números autorrelatados

A maioria dos projetos reais roda um conjunto de dados e relata um número. Esses números têm quatro armadilhas previsíveis:

① A forma da pergunta muda a resposta. Um experimento em estilo de pesquisa produziu uma comparação dura: se uma pergunta de sim/não é escrita como Noul ou como Choice importa mais do que a diferença entre a Jev e o GPT-4.1. Ou seja: em muitas conclusões de “A supera B”, o que realmente faz o trabalho pode ser a formulação da pergunta. Mudar a primitiva exige remedir; os resultados não se transferem.

② Uma execução, amostra pequena, sem variância. Uma “taxa de interceptação de ataques de 100%” autorrelatada pode se apoiar em dez itens. Em outro lugar do mesmo ecossistema, projetos reproduzíveis relatam com um denominador — “0 flips adversariais em 50”. O denominador é a credibilidade.

③ Jitter entre chamadas. Um projeto que usa o modelo como calculadora (pedindo, por caractere, para escolher uma de 13 opções) entrega deliberadamente um botão de Reexecutar para expor o jitter entre duas chamadas sobre a mesma entrada. O jitter não é a parte assustadora; não saber dele é — significa que o limiar que você mediu pode não valer em outro momento.

④ Um especialista vencendo em casa não é uma vitória geral. Um especialista de 706,048 parâmetros (2.8 MB) pontua 99.7% na própria tarefa de preenchimento de formulários, onde o modelo geral obtém 83.6%. Os autores dizem claramente que isto é “um especialista em casa, e não uma vitória geral”. Essa frase deveria ser a leitura padrão de toda entrada de “supera a Jev”.

Em uma frase

O valor de uma avaliação está no seu denominador, na sua variância e nas suas subclasses, não na sua manchete. Um 60 com tamanhos de amostra, um teste de ordem das opções e um resultado negativo supera um 95 sem eles.