Documentation

Guide pratique des modèles de décision

Ces pages répondent à trois questions :

  • Comment les gens s’en servent-ils vraiment dans de vrais projets ?
  • Quelles pratiques reviennent sans cesse, et lesquelles n’existent que parce que quelqu’un s’est fait avoir ?
  • Que disent les preuves sur ce que la documentation ne peut pas trancher — avant tout, si l’on peut faire confiance aux probabilités ?

Chaque chiffre des pages ci-dessous vient d’une source de première main vérifiable publiquement : un recalcul indépendant, une expérience préenregistrée, ou un artefact que le projet a publié lui-même. Laquelle, c’est dit sur la page — car ces trois sources n’ont pas du tout le même poids.

Le fil conducteur

Jev et Laya ont une propriété à la fois facile à comprendre et facile à survendre : la forme de la sortie est garantie. Demande un Choice et tu récupères l’une des options accompagnée d’une probabilité ; demande un Noul et tu récupères un nombre entre 0 et 1. Il n’y a aucun texte à analyser, donc pas de « le modèle a divagué et le programme a planté ».

Mais c’est de la sûreté de typage, pas une probabilité calibrée. La seconde est une autre affirmation, et elle est aujourd’hui contestée publiquement :

  • Un recalcul indépendant a montré que le confidence renvoyé pour les questions Score n’est souvent que la partie fractionnaire du score (121 sorties de ce type, fortement regroupées) — ce qui ressemble à un artefact du format de transmission plutôt qu’à une probabilité calibrée.
  • Une expérience publique a demandé à Jev de deviner un dé équilibré 400 fois. Il a désigné la même face les 400 fois, à une probabilité auto-déclarée moyenne de 82.9% ; le taux de réussite réel était de 19.0%.
  • Un test de calibration indépendant hors distribution a rapporté le signe de l’erreur : Choice et Score sont systématiquement trop confiants, Boolean systématiquement pas assez.

Chaque page ci-dessous revient donc à une phrase : traite la confiance comme un a priori à calibrer, pas comme une garantie. Chaque page porte sur ce que cela signifie dans un cadre précis.

Comment lire les chiffres

Les chiffres ci-dessous viennent de trois types d’endroits, et les pages essaient de dire lesquels :

Source Ce que cela signifie Comment l’utiliser
Auto-déclarée Le résultat de l’auteur lui-même, dans son README ou son blog Une piste, pas une conclusion
Recalculée indépendamment Un tiers l’a refaite, ou a publié quelque chose que tu peux refaire Citable, mais vérifie quand même la taille de l’échantillon
Préenregistrée Critères fixés avant l’exécution, résultats publiés dans tous les cas Le genre le plus informatif

La distinction n’est pas de la pédanterie. Le même modèle apparaît à la fois dans des résultats auto-déclarés « bat Jev » et dans un résultat négatif indépendant — les deux sont vrais, et la différence tient à qui a mesuré, et combien.