Documentation

Initiation à l’IA

Pourquoi TypeSafe entraîne des modèles de décision avec des probabilités calibrées au lieu d’optimiser la génération de texte.

La plupart des produits d’IA sont construits autour d’une conversation entre un modèle et une personne. TypeSafe part d’un pari différent : l’automatisation à grande échelle sera dominée par les interactions IA-à-IA et IA-à-logiciel, donc l’interface machine compte plus que l’interface de chat.

Nous appelons cela la Machine Native Intelligence :

Une IA aux propriétés proches du logiciel, comme la structure, la fiabilité, l’observabilité, la testabilité, la vitesse, la cohérence et le faible coût.

Construire pour la production, pas pour un dieu

TypeSafe ne cherche pas à construire un modèle qui fait tout. Il est conçu pour des systèmes de production où le code a besoin d’une décision étroite qu’il peut inspecter et sur laquelle il peut agir.

Nous nous attendons à ce que l’automatisation de l’IA à grande échelle soit plus proche de 99 % d’interactions machine-à-machine et de 1 % d’interaction humaine. Cela déplace la cible de conception : des réponses agréables à lire vers des sorties qui se comportent de façon prévisible à l’intérieur d’un logiciel.

Lis le manifeste TypeSafe.

Trois approches de post-entraînement

Les modèles de langage préentraînés ont été adaptés de deux grandes façons. TypeSafe en ajoute une troisième. RLHF et RLVR sont présentés ici comme contexte ; la voie d’entraînement de TypeSafe est RLCD.

RLHF

L’apprentissage par renforcement à partir du retour humain a transformé les modèles préentraînés en chatbots. Il entraîne les modèles à produire les réponses que les gens préfèrent.

RLVR

L’apprentissage par renforcement à récompenses vérifiables a créé des modèles de raisonnement forts sur des tâches comme les mathématiques, mais plus lents et plus coûteux.

RLCD

L’apprentissage par renforcement pour des décisions calibrées entraîne TypeSafe à renvoyer des décisions et des probabilités calibrées au lieu de texte généré.

RLHF a servi à entraîner InstructGPT et ChatGPT et a été co-inventé par Diogo Almeida, cofondateur de TypeSafe.

Des modèles de langage préentraînés se ramifient en voies RLHF et RLVR atténuées et une voie de modèle de décision RLCD mise en avant.

RLCD et décisions calibrées

RLCD optimise pour un contrat de sortie différent :

  • Le modèle ne génère pas de texte.
  • Il renvoie des décisions et des probabilités.
  • Une probabilité plus élevée doit correspondre à une plus grande chance que la réponse soit correcte.

La calibration rend l’incertitude exploitable par le logiciel. Sur de nombreuses prédictions d’un modèle bien calibré :

  • Les issues auxquelles une probabilité de 0.2 est attribuée doivent se produire environ 20 % du temps.
  • Les issues auxquelles une probabilité de 0.8 est attribuée doivent se produire environ 80 % du temps.
  • Les issues auxquelles une probabilité de 1.0 est attribuée doivent se produire 100 % du temps.

Ces taux décrivent des groupes de prédictions, pas une garantie sur une réponse individuelle. Vois Confiance pour savoir quand un logiciel doit agir ou escalader.

Les problèmes de RLHF

RLHF apprend à un modèle à dire des choses que les gens préfèrent. Cet objectif fonctionne bien pour les chatbots, mais il peut aussi récompenser le servilisme et les hallucinations au ton assuré.

L’optimisation des préférences provoque aussi une perte de modes (mode dropping) : le modèle apprend à privilégier un style particulier, comme le suivi d’instructions, tout en réduisant la probabilité d’autres sorties possibles.

La distribution de probabilité d’un modèle de base comparée à une distribution resserrée, avec perte de modes, après RLHF.

La perte de modes (mode dropping) est une version plus douce de l’effondrement de mode. Dans le mode de défaillance classique des réseaux antagonistes génératifs, un générateur apprend à produire le même type de sortie encore et encore, parce que cette sortie continue de tromper le discriminateur.

Analogie de l’effondrement de mode
Des caractères répétés illustrent un GAN souffrant d’un effondrement de mode.

RLHF reste adapté aux modèles conversationnels. La position de TypeSafe est que l’automatisation de production a besoin d’un objectif d’entraînement différent — centré sur des décisions contraintes et une incertitude calibrée.