Glosario de modelos de decisión
En la documentación original estos términos están en inglés. Este sitio fija una traducción para cada uno y mantiene el original al lado.
- System Onemodelo System One
Una clase de modelos entrenados para tomar decisiones rápidas y estructuradas que el software puede consumir directamente. La diferencia clave con los modelos de lenguaje generativos es que no producen texto — así que no hay contenido que analizar ni margen para las alucinaciones. La salida son valores tipados y distribuciones de probabilidad con las que tu código puede ramificar, ordenar y enrutar.
- stateestado
El material que un modelo System One evalúa: un correo, un ticket, un documento JSON o un fragmento de texto de un contrato. Todas las preguntas de una solicitud se evalúan contra el mismo estado, de forma independiente. Una consecuencia práctica: añadir preguntas apenas cambia la latencia, y más preguntas no degradan el contexto.
- questionpregunta (primitiva)
Una pregunta tipada que se le hace al estado. Solo hay tres: choice, score y noul. Se llaman primitivas por analogía con las primitivas del software — modulares, componibles y estructuradas. Puedes mezclar las tres y hacer muchas a la vez en una sola solicitud.
- choicechoice (selección)
Elige una opción de un conjunto definido. El Choice de Jev admite hasta 255 opciones. Junto con el elemento seleccionado obtienes una probabilidad para cada opción y una confianza general. Útil para clasificación, enrutamiento y para elegir un candidato entre varios.
- scorescore (puntuación)
Coloca el estado en una escala ordenada y descrita. La respuesta es una puntuación, una probabilidad para cada nivel y la confianza. La diferencia con choice es que los niveles están ordenados. Un error frecuente es plantear una sola pregunta compuesta — descompónla en varios score atómicos y combínalos con pesos que controlas tú en el código.
- noulnoul (juicio de sí o no)
Haz una pregunta de sí o no y recibe la probabilidad de que la respuesta sea sí (0–1). No es lo mismo que la confianza: un noul es una probabilidad sobre el mundo, mientras que la confianza es lo fiable que el modelo considera su propio juicio.
- confidenceconfianza (confidence)
El grado de certeza del modelo sobre su propio juicio. Esta es la salida más útil: la respuesta te dice qué, y la confianza te dice si conviene actuar en consecuencia. El uso típico es el gating (condicionamiento) — aplicar automáticamente por encima de un umbral y derivar a una persona por debajo. Ten en cuenta que no todos los tipos de pregunta la devuelven: choice y score sí; noul no, porque ya es una probabilidad en sí mismo.
- calibrationcalibración
Si las probabilidades significan lo que dicen: entre las muestras que el modelo etiqueta como 70%, alrededor del 70% debería ser realmente positivo. Ambos modelos entrenan esto con aprendizaje por refuerzo frente a reglas de puntuación estrictamente propias (Jev lo llama RLCD), y es la precondición para usar la confianza como umbral. Una confianza sin calibrar es solo un número.
⚠️ Entrenar con un objetivo de calibración no es lo mismo que ofrecer probabilidades calibradas. Hay pruebas públicas en contra: un experimento independiente pidió a Jev que adivinara un dado justo 400 veces y eligió la misma cara todas las veces, con un promedio autoinformado del 82.9% frente a una tasa de acierto real del 19.0%; un test preregistrado fuera de distribución encontró direcciones de sesgo opuestas según la primitiva. En producción, trata la confianza como un prior que hay que calibrar y mide la banda fiable con tus propios datos — consulta las mediciones y la selección de umbral en la guía.
- escalationescalado (derivar a una persona)
Pasar una decisión a una persona cuando la confianza cae en la banda intermedia. Es un nivel diseñado, no una rama de fallo: por encima se aplica automáticamente, por debajo se descarta, y la banda intermedia se escala. Dos cosas se pasan por alto con facilidad: la banda es un coste humano (cuanto más ancha, más trabajo para las personas), y el escalado necesita un fail-safe — sin él, un elemento sin reclamar se queda ahí para siempre mientras el panel se ve exactamente igual que si todo estuviera en orden.
fast-jev-compaction6,653★ · foreman540★ →
- cascadecascada
Deja que el nivel barato decida primero y envía solo lo que no tiene claro al modelo más caro. El ahorro equivale a la proporción de tráfico dentro de la región de alta confianza — en una medición se resolvió el 37% de los casos con una confianza de ≥90% y se eliminó el 37% de las llamadas al modelo grande —, no a un porcentaje fijo. Supone que el modelo pequeño se equivoca como ruido aleatorio; si es sistemáticamente demasiado confiado en una clase de entrada, esa clase nunca se escala.
jev-review (devagrawal09)586★ · jev-search446★ →
- fan-out
Haz muchas preguntas en una sola solicitud y deja que tu código se quede con las respuestas útiles. Lo que ahorras es sobre todo entrada: el mismo estado se envía una vez, así que cuantas más preguntas, más se diluye el coste fijo por solicitud (en una medición: entre el 76 y el 86% de ahorro en la mediana de tokens de entrada con 8 preguntas en paralelo). ⚠️ Sirve para juicios independientes (clasificación, puntuación, filtrado) y no para el ranking, que exige comparar los elementos entre sí: un benchmark encontró que la ruta por lotes no superaba su puerta de calidad de ordenación.
jev-review (devagrawal09)586★ · jev-search446★ →
- guardrailguardarraíl (gating)
Un único juicio estructurado, aplicado antes de que el contenido entre o salga de un sistema, que decide pasar, revisar, bloquear o redirigir. Su principal trade-off no es el umbral, sino hacia qué lado se inclina cuando hay un error: los guardarraíles de riesgo (permisos, secretos, acciones peligrosas) deben ser fail-closed (ante un error, bloquear), y los de rendimiento (comprobaciones de finalización y de formato) deben ser fail-open (ante un error, dejar pasar). Otra práctica recurrente es ejecutar primero las reglas deterministas y dar al modelo solo la zona gris que las reglas no pueden decidir.
fast-jev-compaction6,653★ · foreman540★ →
- abstentionabstención
El mecanismo con el que un modelo marca las respuestas de las que no está seguro, sin descartarlas. Si das a una solicitud un umbral
min_confidence, cualquier respuesta por debajo vuelve marcada comolow_confidence— la respuesta en sí sigue devolviéndose, y quien llama decide qué hacer. La puerta informa de uno de tres estados:passed,abstainedounevaluated(la respuesta no traía una confianza utilizable, así que la puerta no pudo decidir). Sin umbral definido, no aparece ninguna de las claves: la ausencia es el informe, no un cuarto estado.- local deploymentdespliegue local
La práctica de ejecutar modelos de decisión abiertos en tu propia máquina; Ollaya es una forma ya lista de hacerlo. Los rasgos comunes: los pesos viven en tu disco local, el servicio escucha en una dirección de loopback como
127.0.0.1:11435, no se cobra nada por llamada y tus datos se quedan dentro de tu propio entorno. El despliegue y el modelo son dos capas: un mismo despliegue puede servir muchos modelos, y la precisión que obtienes es la del modelo, no la del despliegue.