Réplicas abiertas y el ecosistema systemone
Otras páginas de esta guía tratan sobre cómo usar estos modelos. Esta trata sobre cuál — y por qué esa pregunta es a la vez más fácil de responder que hace un año y más fácil de equivocarse.
Una interfaz se convirtió en el estándar de facto
POST /v1/systemone ya no es solo un detalle del SDK oficial. Se convirtió en un estándar
porque el coste de migración del lado del cliente es casi nulo: cambiar de backend
significa cambiar una variable de entorno con la URL base, sin tocar la forma de las
peticiones ni de las respuestas.
Eso produjo docenas de proyectos que implementan la misma interfaz — desde «convertir cualquier modelo abierto en un modelo de decisiones» (leer los logits, no generar texto), pasando por ajustes finos sobre bases abiertas, hasta runtimes puramente locales y puentes que adaptan otros ecosistemas.
Dónde se sitúan las alternativas locales
Las réplicas abiertas abarcan cinco órdenes de magnitud en número de parámetros, desde unos pocos cientos de miles hasta 27B:
| Implementación | Escala | Licencia | A destacar |
|---|---|---|---|
| Laya | no autorregresiva, ~35 ms por pasada hacia delante | Apache-2.0 | No autorregresiva con probabilidades calibradas por RLCD; en PyPI / Hugging Face |
| von | 395M | — | menos de 15 ms por pasada hacia delante |
| TinyJev | 596M | — | cabeza pointer, devuelve una confianza calibrada pensada para umbralizarse |
| NanoJev | 0.6B | — | distribución de probabilidad completa en una pasada, con pipeline de entrenamiento, pesos y dataset |
| Verdict | 118M | Apache-2.0 | escalado de temperatura + conjunto de abstención split-conformal; afirma que pierde frente a Laya en decisiones con tipo |
| jevos | 1B (MiniCPM5 recortado a 17 capas) | MIT | GGUF q4_k_m de 619 MB; 54 ms corto / 220 ms largo en CPU |
| CLM | 8B | — | reporta hasta 9× menos latencia |
| Jebadiah | 27B / 9B / 4B | Apache-2.0 | distribuido como bf16 / GGUF / MLX |
Unos cuantos números lo bastante concretos como para comprobarlos:
- Una implementación de 1B en CPU (GGUF, 619 MB) tarda 54 ms en peticiones cortas y 220 ms en largas, frente a 344 / 345 ms del servicio alojado — pero puntúa 0.815 frente a 0.927, y solo responde preguntas de sí/no.
- Otro peso abierto puntúa 33.1% frente a 36.7% en 308 decisiones selladas (unos 13 ms).
- Un modelo especialista en rellenar formularios (706,048 parámetros, 2.8 MB) alcanza el 99.7% en su propia tarea, donde el modelo general obtiene el 83.6% — y los autores dicen explícitamente que es ventaja de jugar en casa, no una victoria general.
Lo que esta tabla debe transmitir son magnitudes, no una clasificación. «Seis veces más rápido pero once puntos menos preciso» y «precisión comparable pero solo un tipo de pregunta» son compromisos completamente distintos, y a ambos se los puede describir como «un reemplazo local».
Cumplimiento: el número que no hay que saltarse
Cuando un ecosistema se llena de actividad, la pregunta que hay que hacerse es si todos respetan de verdad la misma interfaz.
Un proyecto convirtió la semántica de /v1/systemone en 48 requisitos comprobables
(por ejemplo: las probabilidades de las opciones de un Choice suman 1 por definición; la
esperanza de un Score es igual a la suma ponderada por probabilidad; el número de opciones
va de 2 a 255; las respuestas no cambian cuando cambia el orden de las preguntas) y distribuye
una suite que prueba cualquier servidor que afirme ser compatible.
Su resultado medido:
De los ocho ports abiertos con más estrellas, solo dos cumplían por completo.
Eso corta en dos direcciones. Para los clientes, significa que «solo cambia la URL base» hay que confirmarlo con la suite, no darlo por hecho. Para quien construye un reemplazo, señala un eje de diferenciación más fácil de alcanzar que la precisión y mucho menos concurrido.
Qué significa esto a la hora de elegir
En conjunto, el centro de gravedad se ha desplazado desde «qué modelo puntúa más alto»:
- La interfaz es compartida y el modelo es reemplazable. Esos 48 requisitos son la definición de reemplazabilidad — confírmalos con la suite primero y luego habla de cualquier otra cosa.
- El foso se trasladó fuera del modelo. Una vez que la capa de modelos es una mercancía, lo difícil de copiar es el contrato de la interfaz + la política de umbrales + la calibración sobre tus propios datos. De eso tratan precisamente las otras páginas, y las tres cosas viven en tu repositorio, no en el de tu proveedor.
- Sitúa las diferencias de precisión en las coordenadas correctas. «83.6% vs 99.7%» es un especialista en su terreno; «0.815 vs 0.927» es un modelo pequeño ejecutándose en CPU que solo responde sí/no. Di las dos mitades, o la tabla engaña.
El tamaño del ecosistema
La huella pública del ecosistema es de aproximadamente 1,100 proyectos (septiembre de 2026).
El volumen no es calidad, ni madurez. Ese recuento incluye a muchísimos proyectos de
un solo commit que comparten un mismo andamiaje: un autor publicando un lote de
repositorios el mismo día, con un AGENTS.md compartido, un historial de un solo commit y
bastante más prosa que código. Pueden ser totalmente legítimos — simplemente están sin
probar. Filtra por «¿hay algo ejecutable?», no por «¿apareció en una lista?».
En una frase
La capa de modelos se está volviendo un consumible; la interfaz, los umbrales y la calibración no. Dedica tu esfuerzo a las tres últimas — la primera es reemplazable en cualquier momento.