Críticas públicas y resultados que no se reprodujeron
La página anterior trató cómo corregir la calibración. Esta trata por qué necesita corrección — reuniendo las pruebas públicas en contra, porque rara vez llegan a la página de inicio de un proyecto.
La forma correcta de leer esta página no es «entonces el modelo es malo», sino: estos son modos de fallo conocidos, y tu sistema tiene que sobrevivir a ellos.
El experimento del dado
El más directo. Pide al modelo que adivine un dado justo, 400 veces:
| Elemento | Resultado |
|---|---|
| Qué cara eligió | la misma cara las 400 veces |
| Probabilidad media autoinformada | 82.9% |
| Tasa de acierto real | 19.0% |
Estos números dicen dos cosas a la vez. Primero, una probabilidad autoinformada puede no aportar ninguna información — 82.9% no te dijo nada fiable sobre una tarea con una tasa de acierto del 19%. Segundo, el modelo no expresa «no lo sé». Con un dado justo la respuesta correcta es «alrededor del 16.7% cada cara», y la forma de la salida — una opción preferida con una probabilidad alta — no tiene manera de decir eso.
Otro resultado del mismo autor merece conservarse: sobre un documento sintético de previsión,
un riesgo de escasez del 30% se convirtió en 5.3% a través de Choice y en 26.7% a través
de Noul. Misma entrada, mismo significado, distinta primitiva — una diferencia de cinco
veces. La elección de primitiva cambia la respuesta, y hay pruebas más sólidas de ello en
la página de evaluación.
«Jev no se puede calibrar»
Una crítica ampliamente difundida argumenta, en el plano estadístico, que la afirmación sobre la calibración no se sostiene con las pruebas disponibles. Un debate con muchos votos positivos formula el mismo punto con más cuidado:
La garantía de seguridad de tipos es real (verificada desde varias direcciones), pero la afirmación sobre la calibración no tiene detrás ninguna ECE ni curva de fiabilidad publicada.
Fíjate en la precisión: no dice que la calibración sea falsa, dice que faltan las pruebas públicas que la respalden. Son afirmaciones distintas, y para una decisión de ingeniería llevan al mismo sitio — no puedes fijar un umbral de producción sobre algo que no tiene una curva de fiabilidad publicada.
Reranking: un resultado negativo completo
Esta clase de resultado es la más valiosa, porque es concreta, reproducible y niega exactamente la implicación de «puede hacer cualquier cosa».
Una evaluación de reranking usó 33,047 ítems, 164 consultas reales y 9,831 pares evaluados, y concluyó que el reranking puro con modelo de decisiones pierde frente a la recuperación vectorial.
La escala es el punto: treinta y tantos mil ítems y más de cien consultas reales no es un entorno de juguete. Y el caso de uso que niega — el reranking semántico — es justo el que más probablemente se da por sentado que se obtiene gratis de la clasificación.
Una decisión dividida
Algunos resultados dependen de qué fila leas. Una comparación de puntuación frente a generación:
En NLI japonés, la puntuación multidimensional con pesos ajustados localmente superó a preguntar directamente (0.9076 vs 0.8373). Pero marcó unas 25 veces más filas benignas difíciles como ataques (37.2% vs 1.5%).
La media mejoró mientras la tasa de falsos positivos de una clase subía 25×. Si marcar incorrectamente entradas benignas es caro en tu sistema, esta mejora es negativa para ti — aunque parezca positiva.
También hay un experimento preregistrado (criterios fijados antes de la ejecución, resultados publicados en cualquier caso) que produjo veredictos inconsistentes entre datasets — aprobando en uno, fallando en otro.
La propia documentación del proveedor lo admite
La página oficial de «jaggedness del modelo» enumera modos de fallo conocidos de la versión pública actual. Eso no es una prueba en contra, pero su existencia dice algo: «este modelo rinde mal en algunas tareas» forma parte de la postura oficial, no es un secreto.
Convertir esta página en reglas
Se derivan tres reglas de ingeniería:
- Nunca razones entre tareas a partir del valor absoluto de una confianza. «0.9 significa 90% correcto» es sencillamente falso en una tarea como la del dado.
- La elección de primitiva es una variable experimental, no una decisión de estilo. La
misma pregunta formulada como
Choiceo comoNoulpuede diferir cinco veces. Mide esa diferencia en lugar de elegir una arbitrariamente. - Mira las subclases, no los totales. El ejemplo del 25× de falsos positivos es completamente invisible en el agregado.
En una frase
Nada de esto es una razón para no usar estos modelos — es una razón para no confiar en los valores por defecto. Todos los patrones del resto de esta guía (el código es dueño del umbral, el gating, la abstención conformal) son formas de trabajar dentro de las restricciones de esta página.