Cascades et questions en parallèle
La motivation derrière les deux patrons est simple : un appel à un grand modèle coûte cher, et la plupart des requêtes sont faciles. Un appel de décision coûte un à deux ordres de grandeur de moins qu’une génération, donc « demande d’abord au moins cher, escalade en cas de doute » est la forme évidente.
Les cascades : ne décider que là où tu es sûr
Une évaluation comparative sur la détection d’hallucinations médicales donne un chiffre net :
Laisse le modèle de décision trancher les 37% de cas où il est sûr à au moins 90%, et il préserve la précision propre de chaque grand modèle tout en supprimant 37% des appels au grand modèle.
Cela mérite d’être cité parce que cela dit ce qu’est réellement l’économie d’une cascade : la part du trafic qui tombe dans ta région de haute confiance, pas un pourcentage fixe. Une confiance plus serrée signifie plus d’économie — tant que cette confiance est réelle, ce qui nous ramène à la calibration.
Deux détails sont faciles à manquer :
① Après l’escalade, le grand modèle ne doit pas recevoir une liberté illimitée. Une implémentation qui passe les lignes incertaines à un LLM force ce LLM à choisir dans le même ensemble d’étiquettes. Sans cela, le « pas sûr » du petit modèle se transforme en une sortie que ton pipeline ne peut pas consommer.
② Une fois un choix fait, tiens-le. Un routeur de modèles conserve sa sélection pour toute la session afin de préserver la continuité du cache de prompt. Rechoisir à chaque tour change le préfixe et jette le cache — l’argent économisé sur l’appel moins cher repart par le cache.
Questions en parallèle : ce que tu économises, c’est l’entrée
Les modèles de décision te permettent de mettre beaucoup de questions dans une seule requête ; les exemples officiels en posent des dizaines d’un coup.
Un benchmark sur 2,976 appels a mesuré ce que cela rapporte :
| Élément | Résultat |
|---|---|
| 8 questions en parallèle contre une à la fois | 76–86% d’économie médiane sur les jetons d’entrée |
| Frais fixes par requête | environ 261 jetons d’entrée |
Donc l’économie n’est pas « le modèle calcule plus vite » — c’est que le même état est envoyé une seule fois. Plus il y a de questions, plus ces frais fixes s’amortissent. Avec une ou deux questions, la différence parallèle/séquentiel est du même ordre que le bruit entre exécutions, et ne justifie pas un changement d’architecture.
Contre-exemple : le traitement par lots peut casser le classement
C’est le résultat le plus contre-intuitif de cette page :
Une extension DuckDB traite 40 lignes par défaut. Le benchmark a trouvé que le chemin par lots échoue à sa barrière de qualité de classement, tandis qu’une ligne par requête la passe.
La raison est reconstructible : emballer 40 lignes dans une seule requête demande au modèle de produire 40 ordres relatifs d’un coup, ce qui est plus difficile que de comparer quelques candidats à la fois. Coût et fidélité sont en conflit ici — et le côté coût est visible (la facture) tandis que le côté fidélité est invisible à moins d’avoir construit une barrière pour le mesurer.
La règle générale : les questions en parallèle conviennent aux questions indépendantes (classification, notation, jugement) et non aux questions qui exigent de comparer des éléments entre eux.
Une précondition de plus : les erreurs doivent être aléatoires
Les cascades fonctionnent grâce à une hypothèse implicite : les erreurs du petit modèle sont du bruit aléatoire, donc le grand modèle peut les corriger.
Un test de calibration indépendant hors distribution contredit cela. Choice et Score
sont systématiquement trop confiants ; Boolean est systématiquement trop
peu confiant. Un biais systématique n’est pas du bruit : il fait que le petit modèle déclare une haute confiance sur
toute une classe d’entrées, si bien que cette classe n’est jamais escaladée et est répondue
faussement à chaque fois.
Le risque, alors, n’est pas « une précision légèrement plus basse » mais tout un type d’entrée étant systématiquement écarté, invisiblement au niveau agrégé. Le trouver exige de regarder la précision par sous-classe, pas globalement.
En une phrase
Une cascade économise proportionnellement au trafic qui se trouve dans sa région de haute confiance ; les questions en parallèle économisent en amortissant des frais fixes. Les deux ont un prix — la première parie que les erreurs du plus petit modèle sont aléatoires, la seconde nuit aux tâches qui demandent une comparaison croisée.