Documentação

Como avaliar um modelo de decisão

Esta página responde a uma pergunta prática: quando dois conjuntos de números discordam, em qual acreditas?

O que é uma avaliação pública

Começa por aquelas que um terceiro consegue repetir. O seu desenho é mais útil do que os seus números.

Opções baralhadas, execuções repetidas. Uma avaliação com respostas publicadas e um executor de reprodução usa 108 perguntas de quatro opções, sem documentos nem ferramentas, com 3 execuções por pergunta e a ordem das opções baralhada; o acaso dá 25%. Reporta o modelo público atual em 84.6%, uma mediana de 199 ms e $0.0088, contra o modelo comparável mais forte em 98.0%, mas 2.12 s e $1.59.

⚠️ A unidade desses dois valores não é declarada na fonte (diz per full run) — não os transformes num preço por chamada.

O ponto não é quem ganha, é que os três eixos estão em cima da mesa — 84.6% a 199 ms e 98.0% a 2.12 s são dois produtos diferentes, não um pior do que o outro.

O baralhar existe para testar uma coisa específica: se o modelo é sensível à ordem das opções, é um componente instável em produção. Essa avaliação reporta esse eixo.

A taxa base é um teto. Outra classificação independente corre PubMedQA, Banking77 e HelpSteer2 com 300 itens × 5 execuções por pergunta e publica todas as probabilidades por decisão sob CC BY 4.0. Duas das suas conclusões importam:

  • No PubMedQA o modelo empata em primeiro lugar, custando 1/28 do valor.
  • No HelpSteer2, nenhum modelo bate a taxa base das etiquetas.

A segunda significa: nesse conjunto de dados, «escolhe sempre a etiqueta mais comum» é uma referência forte e nada a superou. Nessa situação, um primeiro lugar não prova nada — estás a medir a distribuição das etiquetas, não o modelo.

Conta a saída malformada como falha. Um benchmark faz isso explicitamente. Soa a pedantismo até reparares que decide se as pontuações de modelos diferentes podem sequer ser comparadas — um modelo com permissão para emitir valores ilegais tem uma exatidão sem sentido.

Comparação estatística: maior não é melhor

84.6% contra 85.1% significa que um é melhor?

Não necessariamente. Com n=100 isso está bem dentro do ruído. Um teste que já foi de facto usado aqui é o de McNemar — compara os casos em que dois modelos discordam nos mesmos itens, não dois totais.

Uma réplica reproduziu respostas publicadas em 256 juízos e obteve 231 contra 238, McNemar p = 0.21 — sem diferença significativa face ao modelo original. «Sem diferença significativa» é uma conclusão perfeitamente respeitável, e muito mais útil do que insistir que um está mais perto.

Uma variante mais estrita é o pré-registo: fixa os critérios e depois corre. Um benchmark de ranking fez exatamente isso e reportou «passa no 20 Newsgroups, falha quatro de seis condições no Amazon ESCI». Um resultado meio a meio como esse é mais credível do que um tudo-passou — mostra que os critérios estão mesmo a fazer trabalho.

Quatro armadilhas nos números auto-reportados

A maioria dos projetos reais corre um conjunto de dados e reporta um número. Esses números têm quatro armadilhas previsíveis:

① A forma da pergunta muda a resposta. Uma experiência estilo inquérito produziu uma comparação dura: se uma pergunta de sim/não é escrita como Noul ou como Choice importa mais do que a diferença entre o Jev e o GPT-4.1. Ou seja: em muitas conclusões «A bate B», o que está realmente a fazer o trabalho pode ser a formulação da pergunta. Mudar a primitiva exige voltar a medir; os resultados não transitam.

② Uma execução, amostra pequena, sem variância. Uma «taxa de interceção de ataques de 100%» auto-reportada pode assentar em dez itens. Noutro ponto do mesmo ecossistema, projetos reproduzíveis reportam com um denominador — «0 flips adversariais em 50». O denominador é a credibilidade.

③ Jitter entre chamadas. Um projeto que usa o modelo como calculadora (pedindo-lhe, por caráter, que escolha uma de 13 opções) inclui deliberadamente um botão de repetição para expor o jitter entre duas chamadas com a mesma entrada. O jitter não é a parte assustadora; não o conhecer é que é — significa que o limiar que mediste pode não valer noutro momento.

④ Um especialista a ganhar em casa não é uma vitória geral. Um especialista de 706,048 parâmetros (2.8 MB) obtém 99.7% na sua própria tarefa de preenchimento de formulários onde o modelo geral obtém 83.6%. Os autores dizem claramente que isto é «um especialista em casa e não uma vitória geral». Essa frase devia ser a leitura predefinida de todas as entradas «bate o Jev».

Numa frase

O valor de uma avaliação está no seu denominador, na sua variância e nas suas subclasses, não no seu título. Um 60 com dimensões de amostra, um teste de ordem de opções e um resultado negativo bate um 95 sem nada disso.