Documentación

Réplicas abiertas y el ecosistema systemone

Otras páginas de esta guía tratan sobre cómo usar estos modelos. Esta trata sobre cuál — y por qué esa pregunta es a la vez más fácil de responder que hace un año y más fácil de equivocarse.

Una interfaz se convirtió en el estándar de facto

POST /v1/systemone ya no es solo un detalle del SDK oficial. Se convirtió en un estándar porque el coste de migración del lado del cliente es casi nulo: cambiar de backend significa cambiar una variable de entorno con la URL base, sin tocar la forma de las peticiones ni de las respuestas.

Eso produjo docenas de proyectos que implementan la misma interfaz — desde «convertir cualquier modelo abierto en un modelo de decisiones» (leer los logits, no generar texto), pasando por ajustes finos sobre bases abiertas, hasta runtimes puramente locales y puentes que adaptan otros ecosistemas.

Dónde se sitúan las alternativas locales

Las réplicas abiertas abarcan cinco órdenes de magnitud en número de parámetros, desde unos pocos cientos de miles hasta 27B:

Implementación Escala Licencia A destacar
Laya no autorregresiva, ~35 ms por pasada hacia delante Apache-2.0 No autorregresiva con probabilidades calibradas por RLCD; en PyPI / Hugging Face
von 395M — menos de 15 ms por pasada hacia delante
TinyJev 596M — cabeza pointer, devuelve una confianza calibrada pensada para umbralizarse
NanoJev 0.6B — distribución de probabilidad completa en una pasada, con pipeline de entrenamiento, pesos y dataset
Verdict 118M Apache-2.0 escalado de temperatura + conjunto de abstención split-conformal; afirma que pierde frente a Laya en decisiones con tipo
jevos 1B (MiniCPM5 recortado a 17 capas) MIT GGUF q4_k_m de 619 MB; 54 ms corto / 220 ms largo en CPU
CLM 8B — reporta hasta 9× menos latencia
Jebadiah 27B / 9B / 4B Apache-2.0 distribuido como bf16 / GGUF / MLX

Unos cuantos números lo bastante concretos como para comprobarlos:

  • Una implementación de 1B en CPU (GGUF, 619 MB) tarda 54 ms en peticiones cortas y 220 ms en largas, frente a 344 / 345 ms del servicio alojado — pero puntúa 0.815 frente a 0.927, y solo responde preguntas de sí/no.
  • Otro peso abierto puntúa 33.1% frente a 36.7% en 308 decisiones selladas (unos 13 ms).
  • Un modelo especialista en rellenar formularios (706,048 parámetros, 2.8 MB) alcanza el 99.7% en su propia tarea, donde el modelo general obtiene el 83.6% — y los autores dicen explícitamente que es ventaja de jugar en casa, no una victoria general.

Lo que esta tabla debe transmitir son magnitudes, no una clasificación. «Seis veces más rápido pero once puntos menos preciso» y «precisión comparable pero solo un tipo de pregunta» son compromisos completamente distintos, y a ambos se los puede describir como «un reemplazo local».

Cumplimiento: el número que no hay que saltarse

Cuando un ecosistema se llena de actividad, la pregunta que hay que hacerse es si todos respetan de verdad la misma interfaz.

Un proyecto convirtió la semántica de /v1/systemone en 48 requisitos comprobables (por ejemplo: las probabilidades de las opciones de un Choice suman 1 por definición; la esperanza de un Score es igual a la suma ponderada por probabilidad; el número de opciones va de 2 a 255; las respuestas no cambian cuando cambia el orden de las preguntas) y distribuye una suite que prueba cualquier servidor que afirme ser compatible.

Su resultado medido:

De los ocho ports abiertos con más estrellas, solo dos cumplían por completo.

Eso corta en dos direcciones. Para los clientes, significa que «solo cambia la URL base» hay que confirmarlo con la suite, no darlo por hecho. Para quien construye un reemplazo, señala un eje de diferenciación más fácil de alcanzar que la precisión y mucho menos concurrido.

Qué significa esto a la hora de elegir

En conjunto, el centro de gravedad se ha desplazado desde «qué modelo puntúa más alto»:

  1. La interfaz es compartida y el modelo es reemplazable. Esos 48 requisitos son la definición de reemplazabilidad — confírmalos con la suite primero y luego habla de cualquier otra cosa.
  2. El foso se trasladó fuera del modelo. Una vez que la capa de modelos es una mercancía, lo difícil de copiar es el contrato de la interfaz + la política de umbrales + la calibración sobre tus propios datos. De eso tratan precisamente las otras páginas, y las tres cosas viven en tu repositorio, no en el de tu proveedor.
  3. Sitúa las diferencias de precisión en las coordenadas correctas. «83.6% vs 99.7%» es un especialista en su terreno; «0.815 vs 0.927» es un modelo pequeño ejecutándose en CPU que solo responde sí/no. Di las dos mitades, o la tabla engaña.

El tamaño del ecosistema

La huella pública del ecosistema es de aproximadamente 1,100 proyectos (septiembre de 2026).

El volumen no es calidad, ni madurez. Ese recuento incluye a muchísimos proyectos de un solo commit que comparten un mismo andamiaje: un autor publicando un lote de repositorios el mismo día, con un AGENTS.md compartido, un historial de un solo commit y bastante más prosa que código. Pueden ser totalmente legítimos — simplemente están sin probar. Filtra por «¿hay algo ejecutable?», no por «¿apareció en una lista?».

En una frase

La capa de modelos se está volviendo un consumible; la interfaz, los umbrales y la calibración no. Dedica tu esfuerzo a las tres últimas — la primera es reemplazable en cualquier momento.