Cómo evaluar un modelo de decisiones
Esta página responde a una pregunta práctica: cuando dos conjuntos de números no coinciden, ¿a cuál crees?
Cómo es una evaluación pública
Empieza por las que un tercero puede repetir. Su diseño es más útil que sus números.
Opciones mezcladas, ejecuciones repetidas. Una evaluación con respuestas publicadas y un runner de reproducción usa 108 preguntas de cuatro opciones, sin documentos ni herramientas, con 3 ejecuciones por pregunta y orden de opciones mezclado; adivinar al azar es el 25%. Reporta el modelo público actual en 84.6%, una mediana de 199 ms y $0.0088, frente al modelo comparable más fuerte en 98.0% pero 2.12 s y $1.59.
⚠️ La unidad de esas dos cifras no se indica en la fuente (dice per full run) — no las
conviertas en un precio por llamada.
El punto no es quién gana, sino que los tres ejes están sobre la mesa — 84.6% a 199 ms y 98.0% a 2.12 s son dos productos distintos, no uno peor que el otro.
El mezclado existe para probar una cosa concreta: si el modelo es sensible al orden de las opciones, es un componente inestable en producción. Esa evaluación reporta ese eje.
La tasa base es un techo. Otra clasificación independiente ejecuta PubMedQA, Banking77 y HelpSteer2 con 300 ítems × 5 ejecuciones por pregunta y publica cada probabilidad por decisión bajo CC BY 4.0. Dos de sus hallazgos importan:
- En PubMedQA el modelo empata en primer lugar costando 1/28 de lo que cuesta.
- En HelpSteer2, ningún modelo supera la tasa base de la etiqueta.
Lo segundo significa: en ese dataset «elige siempre la etiqueta más común» es una línea base fuerte y nada la superó. En esa situación un primer puesto no demuestra nada — estás midiendo la distribución de etiquetas, no el modelo.
Cuenta la salida malformada como fallo. Un benchmark lo hace explícitamente. Suena pedante hasta que te das cuenta de que decide si las puntuaciones de distintos modelos pueden compararse siquiera — un modelo al que se le permite emitir valores ilegales tiene una precisión sin sentido.
Comparación estadística: más grande no es mejor
¿Que 84.6% frente a 85.1% significa que uno es mejor?
No necesariamente. Con n=100 eso está claramente dentro del ruido. Una prueba que se ha usado de verdad aquí es la de McNemar — compara los casos en que dos modelos discrepan sobre los mismos ítems, no dos totales.
Una réplica reprodujo las respuestas publicadas en 256 juicios y obtuvo 231 frente a 238, McNemar p = 0.21 — ninguna diferencia significativa con el modelo original. «Ninguna diferencia significativa» es una conclusión completamente respetable, y mucho más útil que insistir en que uno está más cerca.
Una variante más estricta es el preregistro: fija los criterios y luego ejecuta. Un benchmark de clasificación hizo exactamente eso y reportó «aprueba en 20 Newsgroups, falla cuatro de seis condiciones en Amazon ESCI». Un resultado mitad y mitad como ese es más creíble que uno que aprueba todo — demuestra que los criterios están haciendo trabajo de verdad.
Cuatro trampas de los números autoinformados
La mayoría de los proyectos reales ejecutan un dataset y reportan un número. Esos números tienen cuatro trampas predecibles:
① La forma de la pregunta cambia la respuesta.
Un experimento tipo encuesta produjo una comparación contundente: que una pregunta de
sí/no se escriba como Noul o como Choice importa más que la diferencia entre Jev y
GPT-4.1. Es decir: en muchas conclusiones de «A supera a B», lo que realmente hace el
trabajo puede ser la formulación de la pregunta. Cambiar la primitiva exige volver a
medir; los resultados no se trasladan.
② Una sola ejecución, muestra pequeña, sin varianza. Una «tasa de intercepción de ataques del 100%» autoinformada puede basarse en diez ítems. En otros puntos del mismo ecosistema, los proyectos reproducibles reportan con un denominador — «0 volteos adversarios de 50». El denominador es la credibilidad.
③ Jitter entre llamadas. Un proyecto que usa el modelo como calculadora (pidiéndole, por carácter, que elija una de 13 opciones) incluye deliberadamente un botón de Rerun para exponer el jitter entre dos llamadas con la misma entrada. El jitter no es lo que asusta; no saber de él sí — significa que el umbral que mediste puede no sostenerse en otro momento.
④ Que un especialista gane en su terreno no es una victoria general. Un especialista de 706,048 parámetros (2.8 MB) puntúa 99.7% en su propia tarea de rellenar formularios, donde el modelo general obtiene 83.6%. Los autores dicen sin rodeos que esto es «un especialista en su terreno más que una victoria general». Esa frase debería ser la lectura por defecto de toda entrada de «supera a Jev».
En una frase
El valor de una evaluación está en su denominador, su varianza y sus subclases, no en su titular. Un 60 con tamaños de muestra, una prueba de orden de opciones y un resultado negativo supera a un 95 sin nada de eso.