Documentación

Guía práctica del modelo de decisiones

Estas páginas responden a tres preguntas:

  • ¿Cómo se usa en la práctica en proyectos reales?
  • ¿Qué prácticas se repiten, y cuáles existen solo porque alguien se quemó con ellas?
  • ¿Qué dice la evidencia sobre la parte que la documentación no puede zanjar — sobre todo, si se puede confiar en las probabilidades?

Cada cifra de las páginas siguientes procede de un registro de primera mano verificable en público: un recálculo independiente, un experimento preregistrado o un artefacto que el propio proyecto publicó. En cada página se dice de cuál se trata — porque esos tres tipos tienen un peso muy distinto.

El hilo conductor

Jev y Laya tienen una propiedad que es a la vez fácil de entender y fácil de vender en exceso: la forma de la salida está garantizada. Pide un Choice y recibes una de las opciones más una probabilidad; pide un Noul y recibes un número entre 0 y 1. No hay texto que analizar, así que tampoco existe eso de «el modelo se puso a divagar y el programa se cayó».

Pero eso es seguridad de tipos, no probabilidad calibrada. Lo segundo es una afirmación distinta, y hoy se discute en público:

  • Un recálculo independiente encontró que la confidence devuelta para preguntas de Score es con frecuencia solo la parte fraccionaria de la puntuación (121 salidas de ese tipo, muy agrupadas) — lo que parece un artefacto del formato de transmisión más que una probabilidad calibrada.
  • Un experimento público pidió a Jev que adivinara un dado justo 400 veces. Eligió la misma cara las 400 veces, con una probabilidad media autoinformada del 82.9%; la tasa de acierto real fue del 19.0%.
  • Una prueba independiente de calibración fuera de distribución reportó el signo del error: Choice y Score son sistemáticamente demasiado confiados, Boolean sistemáticamente poco confiado.

Así que todas las páginas siguientes vuelven una y otra vez a una frase: trata la confianza como un prior que hay que calibrar, no como una garantía. Cada página trata sobre lo que eso significa en un entorno concreto.

Cómo leer los números

Las cifras siguientes proceden de tres tipos de fuentes, y las páginas intentan decir de cuál:

Fuente Qué significa Cómo usarla
Autoinformado El resultado del propio autor, en su README o su blog Una pista, no una conclusión
Recalculado de forma independiente Un tercero lo repitió, o publicó algo que puedes repetir Citable, pero revisa igualmente el tamaño de la muestra
Preregistrado Criterios fijados antes de la ejecución, resultados publicados en cualquier caso El tipo más informativo

La distinción no es pedantería. El mismo modelo aparece tanto en resultados autoinformados de «supera a Jev» como en un resultado negativo independiente — ambos son ciertos, y la diferencia está en quién lo midió y cuánto.