Documentación

Introducción a la IA

Por qué TypeSafe entrena modelos de decisión con probabilidades calibradas en lugar de optimizar para texto generado.

La mayoría de los productos de IA se construyen en torno a una conversación entre un modelo y una persona. TypeSafe parte de una apuesta distinta: la automatización a gran escala estará dominada por interacciones de IA a IA y de IA a software, así que la interfaz máquina-máquina importa más que la interfaz de chat.

A esto lo llamamos Machine Native Intelligence:

IA con propiedades similares a las del software, como estructura, fiabilidad, observabilidad, capacidad de prueba, velocidad, consistencia y bajo coste.

Construir producción, no un dios

TypeSafe no intenta construir un modelo que lo haga todo. Está diseñado para sistemas de producción en los que el código necesita una decisión acotada que pueda inspeccionar y sobre la que pueda actuar.

Nuestra expectativa es que la automatización de IA a gran escala se acerque más a un 99% de interacciones máquina a máquina y un 1% de interacción humana. Eso desplaza el objetivo de diseño desde respuestas que se leen bien hacia salidas que se comportan de forma predecible dentro del software.

Lee el manifiesto de TypeSafe.

Tres enfoques de post-entrenamiento

Los modelos de lenguaje preentrenados se han adaptado de dos maneras principales. TypeSafe añade una tercera. RLHF y RLVR se muestran aquí como contexto; la ruta de entrenamiento de TypeSafe es RLCD.

RLHF

El aprendizaje por refuerzo a partir de retroalimentación humana convirtió los modelos preentrenados en chatbots. Entrena a los modelos para producir las respuestas que las personas prefieren.

RLVR

El aprendizaje por refuerzo con recompensas verificables creó modelos de razonamiento que son fuertes en tareas como las matemáticas, pero más lentos y más caros.

RLCD

El aprendizaje por refuerzo para decisiones calibradas entrena a TypeSafe para devolver decisiones y probabilidades calibradas en lugar de texto generado.

RLHF se usó para entrenar InstructGPT y ChatGPT y fue coinventado por Diogo Almeida, cofundador de TypeSafe.

Modelos de lenguaje preentrenados que se ramifican en rutas RLHF y RLVR atenuadas y una ruta de modelo de decisión RLCD destacada.

RLCD y decisiones calibradas

RLCD optimiza para un contrato de salida distinto:

  • El modelo no genera texto.
  • Devuelve decisiones y probabilidades.
  • Una probabilidad más alta debería corresponder a una mayor probabilidad de que la respuesta sea correcta.

La calibración hace que el software pueda usar la incertidumbre. A lo largo de muchas predicciones de un modelo bien calibrado:

  • Los resultados a los que se asigna una probabilidad de 0.2 deberían ocurrir aproximadamente el 20% de las veces.
  • Los resultados a los que se asigna una probabilidad de 0.8 deberían ocurrir aproximadamente el 80% de las veces.
  • Los resultados a los que se asigna una probabilidad de 1.0 deberían ocurrir el 100% de las veces.

Estas tasas describen grupos de predicciones, no una garantía sobre ninguna respuesta individual. Consulta Confianza para saber cuándo debería actuar el software y cuándo escalar.

Los problemas de RLHF

RLHF enseña a un modelo a decir cosas que las personas prefieren. Ese objetivo funciona bien para los chatbots, pero también puede recompensar el servilismo y las alucinaciones que suenan seguras.

La optimización de preferencias también provoca pérdida de modos (mode dropping): el modelo aprende a favorecer un estilo concreto, como seguir instrucciones, mientras reduce la probabilidad de otras salidas posibles.

La distribución de probabilidad de un modelo base comparada con una distribución estrechada y con pérdida de modos tras RLHF.

La pérdida de modos es una versión más leve del colapso de modos. En el modo de fallo clásico de las redes generativas adversarias, un generador aprende a producir el mismo tipo de salida una y otra vez porque esa salida sigue engañando al discriminador.

Analogía del colapso de modos
Caracteres repetidos que ilustran una GAN que sufre un colapso de modos.

RLHF sigue siendo una buena opción para los modelos conversacionales. La postura de TypeSafe es que la automatización de producción necesita un objetivo de entrenamiento distinto: uno centrado en decisiones restringidas y en incertidumbre calibrada.