Documentation

Comment évaluer un modèle de décision

Cette page répond à une question pratique : quand deux séries de chiffres se contredisent, laquelle croire ?

À quoi ressemble une évaluation publique

Commence par celles qu’un tiers peut refaire. Leur conception est plus utile que leurs chiffres.

Options mélangées, exécutions répétées. Une évaluation avec réponses publiées et un exécuteur de reproduction utilise 108 questions à quatre options, sans documents ni outils, avec 3 exécutions par question et un ordre d’options mélangé ; la devinette aléatoire est à 25%. Elle rapporte le modèle public actuel à 84.6%, une médiane de 199 ms et 0.0088 $, contre le modèle comparable le plus fort à 98.0% mais 2.12 s et 1.59 $.

⚠️ L’unité de ces deux chiffres n’est pas indiquée dans la source (elle dit per full run) — ne les transforme pas en un prix par appel.

Le point n’est pas qui gagne, c’est que les trois axes sont sur la table — 84.6% à 199 ms et 98.0% à 2.12 s sont deux produits différents, pas l’un moins bon que l’autre.

Le mélange existe pour tester une chose précise : si le modèle est sensible à l’ordre des options, c’est un composant instable en production. Cette évaluation rapporte cet axe.

Le taux de base est un plafond. Un autre classement indépendant exécute PubMedQA, Banking77 et HelpSteer2 avec 300 items × 5 exécutions par question et publie chaque probabilité par décision sous CC BY 4.0. Deux de ses constats comptent :

  • Sur PubMedQA, le modèle finit à égalité en tête tout en coûtant 1/28 du prix.
  • Sur HelpSteer2, aucun modèle ne bat le taux de base des étiquettes.

Le second signifie : sur ce jeu de données, « choisis toujours l’étiquette la plus fréquente » est une baseline solide et rien ne l’a dépassée. Dans cette situation, une première place ne prouve rien — tu mesures la distribution des étiquettes, pas le modèle.

Compte une sortie malformée comme un échec. Un benchmark le fait explicitement. Cela semble pointilleux jusqu’à ce qu’on remarque que cela décide si les scores de différents modèles peuvent être comparés du tout — un modèle autorisé à émettre des valeurs illégales a une précision vide de sens.

Comparaison statistique : plus grand n’est pas mieux

Est-ce que 84.6% contre 85.1% signifie que l’un est meilleur ?

Pas forcément. À n=100, c’est bien à l’intérieur du bruit. Un test réellement utilisé ici est celui de McNemar — il compare les cas où deux modèles ne sont pas d’accord sur les mêmes items, pas deux totaux.

Une réplique a rejoué des réponses publiées sur 256 jugements et a obtenu 231 contre 238, McNemar p = 0.21 — aucune différence significative avec le modèle d’origine. « Aucune différence significative » est une conclusion tout à fait respectable, et bien plus utile que de s’acharner à dire que l’un est plus proche.

Une variante plus stricte est le préenregistrement : fixe les critères, puis exécute. Un benchmark de classement l’a fait exactement cela et a rapporté « passe sur 20 Newsgroups, échoue quatre des six conditions sur Amazon ESCI ». Un résultat moitié-moitié comme celui-là est plus crédible qu’un tout-réussi — il montre que les critères font réellement leur travail.

Quatre pièges des chiffres auto-déclarés

La plupart des vrais projets exécutent un jeu de données et rapportent un chiffre. Ces chiffres ont quatre pièges prévisibles :

① La forme de la question change la réponse. Une expérience de type enquête a produit une comparaison nette : qu’une question oui/non soit écrite comme Noul ou comme Choice compte plus que l’écart entre Jev et GPT-4.1. Autrement dit : dans beaucoup de conclusions « A bat B », ce qui fait réellement le travail peut être la formulation de la question. Changer la primitive oblige à remesurer ; les résultats ne se transfèrent pas.

② Une seule exécution, petit échantillon, pas de variance. Un « taux d’interception d’attaques de 100% » auto-déclaré peut reposer sur dix items. Ailleurs dans le même écosystème, des projets reproductibles rapportent avec un dénominateur — « 0 bascule adverse sur 50 ». Le dénominateur, c’est la crédibilité.

③ La gigue entre appels. Un projet qui utilise le modèle comme calculatrice (lui demandant, caractère par caractère, de choisir l’une de 13 options) livre délibérément un bouton Relancer pour exposer la gigue entre deux appels sur la même entrée. La gigue n’est pas ce qui fait peur ; ne pas la connaître l’est — cela signifie que le seuil que tu as mesuré peut ne pas tenir à un autre moment.

④ Un spécialiste qui gagne à domicile n’est pas une victoire générale. Un spécialiste de 706,048 paramètres (2.8 MB) obtient 99.7% sur sa propre tâche de remplissage de formulaires là où le modèle général obtient 83.6%. Les auteurs disent franchement que c’est « un spécialiste à domicile plutôt qu’une victoire générale ». Cette phrase devrait être la lecture par défaut de chaque entrée « bat Jev ».

En une phrase

La valeur d’une évaluation est dans son dénominateur, sa variance et ses sous-classes, pas dans son chiffre vedette. Un 60 avec des tailles d’échantillon, un test d’ordre des options et un résultat négatif bat un 95 sans eux.