Glossaire des modèles de décision

Dans la documentation d’origine, ces termes sont en anglais. Cette page fixe une traduction pour chacun et conserve l’original anglais à côté.

System Onemodèle System One

Une classe de modèles entraînés à prendre des décisions rapides et structurées que le logiciel peut exploiter directement. La différence clé avec les LLM génératifs est qu’ils ne produisent pas de texte — il n’y a donc rien à analyser ni de place pour les hallucinations. La sortie est faite de valeurs typées et de distributions de probabilité sur lesquelles ton code peut brancher, trier et router.

See also state · question

Source System One

stateétat

Le matériau qu’évalue un modèle System One : un e-mail, un ticket, un document JSON, un passage de texte de contrat. Chaque question d’une requête est évaluée indépendamment par rapport au même état. Une conséquence pratique : ajouter des questions ne change presque pas la latence, et plus de questions ne dégradent pas le contexte.

See also question · choice

Source État

questionquestion (primitive)

Une question typée posée à l’état. Il y en a exactement trois : choice, score et noul. On les appelle primitives par analogie avec les primitives logicielles — modulaires, composables, structurées. Tu peux mélanger les trois et en poser plusieurs d’un coup dans une seule requête.

See also choice · score · noul

Source Primitives (Questions)

choicechoice (choix)

Choisis une option dans un ensemble défini. Le Choice de Jev accepte jusqu’à 255 options. Outre l’élément sélectionné, tu obtiens une probabilité pour chaque option et une confiance globale. Utile pour la classification, le routage et pour choisir un candidat parmi plusieurs.

See also score · noul · confidence

Source Choice

scorescore (notation)

Place l’état sur une échelle ordonnée et décrite. La réponse est un score, une probabilité pour chaque niveau et la confiance. La différence avec choice est que les niveaux sont ordonnés. Une erreur fréquente consiste à poser une seule question composite — décompose-la en plusieurs score atomiques et combine-les avec des pondérations que tu contrôles dans le code.

See also choice · noul · confidence

Source Score

noulnoul (jugement oui/non)

Pose une question fermée (oui/non) et obtiens la probabilité que la réponse soit oui (0–1). Ce n’est pas la même chose que la confiance : un noul est une probabilité sur le monde, tandis que la confiance est le degré de fiabilité que le modèle accorde à son propre jugement.

See also confidence · choice

Source Noul

confidenceconfiance (confidence)

Le degré de certitude du modèle quant à son propre jugement. C’est la sortie la plus utile : la réponse te dit quoi, la confiance te dit s’il faut agir en conséquence. L’usage canonique est le gating — appliquer automatiquement au-dessus d’un seuil, router vers un humain en dessous. Note que tous les types de question ne la renvoient pas : choice et score oui ; noul non, puisqu’il est lui-même une probabilité.

See also noul · score

Source Confiance

calibration

Si les probabilités veulent dire ce qu’elles annoncent : parmi les échantillons que le modèle annonce à 70%, environ 70% devraient être réellement positifs. Les deux modèles entraînent cela par apprentissage par renforcement contre des règles de score strictement propres (Jev appelle cela RLCD), et c’est la condition préalable pour utiliser la confiance comme seuil. Une confiance non calibrée n’est qu’un nombre.

⚠️ S’entraîner avec un objectif de calibration n’est pas la même chose que livrer des probabilités calibrées. Il existe des preuves publiques du contraire : une expérience indépendante a demandé à Jev de deviner un dé équilibré 400 fois, et il a choisi la même face à chaque fois, avec une moyenne auto-déclarée de 82.9% contre un taux de réussite réel de 19.0% ; un test hors distribution préenregistré a trouvé des directions de biais opposées selon la primitive. En production, traite la confiance comme un a priori à calibrer et mesure la bande fiable sur tes propres données — voir les mesures et le choix du seuil dans le guide.

Projets SemIf4,162★ · NanoJev2,159★ →

See also confidence · noul

Source Confiance

escalationescalade (passage à un humain)

Confier une décision à un humain lorsque la confiance tombe dans la bande intermédiaire. C’est un palier conçu, pas une branche d’échec : appliquer automatiquement au-dessus, écarter en dessous, escalader la bande intermédiaire. Deux choses sont faciles à manquer : la bande est un coût humain (bande plus large, plus de travail humain), et l’escalade nécessite un fail-safe — sans lui, un élément non pris en charge reste là pour toujours pendant que le tableau de bord ressemble exactement à « tout va bien ».

Projets fast-jev-compaction6,653★ · foreman540★ →

See also confidence · calibration

Source Routage conditionné par la confiance

cascade

Laisse l’étage bon marché décider en premier et n’envoie au modèle plus cher que ce dont il n’est pas sûr. L’économie correspond à la part du trafic dans la région de haute confiance — dans une mesure, 37% des cas ont été tranchés à ≥90% de confiance et 37% des appels au grand modèle supprimés —, et non à un pourcentage fixe. Elle suppose que le petit modèle se trompe comme un bruit aléatoire ; s’il est systématiquement trop confiant sur une classe d’entrées, cette classe n’est jamais escaladée.

Projets jev-review (devagrawal09)586★ · jev-search446★ →

See also escalation · fan-out

Source Cascade de SDE

fan-out

Pose beaucoup de questions dans une seule requête et laisse ton code garder les réponses utiles. Ce que tu économises, c’est surtout de l’entrée : le même état n’est envoyé qu’une fois, donc plus il y a de questions, plus la surcharge fixe par requête se répartit finement (une mesure : 76–86% d’économie médiane sur les jetons d’entrée avec 8 questions en parallèle). ⚠️ Il convient aux jugements indépendants — classification, notation, filtrage — et pas au classement, qui exige de comparer les éléments entre eux : un benchmark a constaté que le chemin par lots ne passait pas son seuil de qualité de classement.

Projets jev-review (devagrawal09)586★ · jev-search446★ →

See also cascade · question

Source Fan-out spéculatif

guardrailgarde-fou (guardrail)

Un jugement structuré, appliqué avant que le contenu n’entre dans un système ou n’en sorte, qui décide passer / examiner / bloquer / réacheminer. Son compromis clé n’est pas le seuil mais de quel côté il bascule en cas d’erreur : les garde-fous de risque (permissions, secrets, actions dangereuses) doivent être fail-closed, les garde-fous de débit (contrôles de complétion, contrôles de format) doivent être fail-open. Une deuxième pratique récurrente consiste à exécuter d’abord les règles déterministes et à ne donner au modèle que la zone grise que les règles ne peuvent pas trancher.

Projets fast-jev-compaction6,653★ · foreman540★ →

See also escalation · noul

Source Garde-fous pour les LLM

abstention

Le mécanisme par lequel un modèle signale les réponses dont il n’est pas sûr, sans les écarter. Donne à une requête un seuil min_confidence, et toute réponse en dessous revient marquée low_confidence — la réponse elle-même est toujours renvoyée, et l’appelant décide quoi faire. La porte rapporte l’un de trois états : passed, abstained ou unevaluated (la réponse ne portait aucune confiance utilisable, donc la porte n’a pas pu trancher). Sans seuil défini, aucune des clés n’apparaît : l’absence est le rapport, pas un quatrième état.

See also confidence · calibration · guardrail

Source API HTTP

local deploymentdéploiement local

La pratique consistant à exécuter des modèles de décision ouverts sur ta propre machine — Ollaya en est un moyen tout prêt. Les marqueurs : les poids résident sur le disque local, le service écoute sur une adresse de loopback comme 127.0.0.1:11435, rien n’est facturé par appel et tes données restent dans ton propre environnement. Le déploiement et le modèle sont deux couches : un même déploiement peut servir de nombreux modèles, et la précision que tu obtiens est celle du modèle, pas celle du déploiement.

See also System One

Source Ollaya · Quickstart