오픈 재현 구현과 systemone 생태계
이 가이드의 다른 페이지들은 이 모델들을 어떻게 쓰는지를 다룹니다. 이 페이지는 어느 것을 쓸지를 다룹니다 — 그리고 왜 그 질문이 1년 전보다 답하기 쉬우면서도 동시에 틀리기 쉬운지를 다룹니다.
하나의 인터페이스가 사실상 표준이 되었다
POST /v1/systemone은 더 이상 공식 SDK의 세부 사항이 아닙니다. 클라이언트 쪽
마이그레이션 비용이 거의 0이기 때문에 표준이 되었습니다. 백엔드를 바꾸는 것은 base URL
환경 변수를 바꾸는 일이고, 요청과 응답의 형태는 그대로입니다.
그 결과 같은 인터페이스를 구현하는 수십 개 프로젝트가 나왔습니다. “아무 오픈 모델이나 의사결정 모델로 바꾸기”(로짓을 읽고 텍스트는 생성하지 않음)부터, 오픈 베이스에 대한 파인튜닝, 순수 로컬 런타임, 다른 생태계를 적응시키는 브리지까지입니다.
로컬 대안들은 어디에 있는가
오픈 재현 구현은 파라미터 수에서 다섯 자릿수에 걸쳐 있습니다. 수십만에서 27B까지입니다.
| 구현 | 규모 | 라이선스 | 주목할 점 |
|---|---|---|---|
| Laya | 비자기회귀, 순전파당 약 35 ms | Apache-2.0 | RLCD로 캘리브레이션된 확률을 갖춘 비자기회귀 모델, PyPI / Hugging Face에 있음 |
| von | 395M | — | 순전파당 15 ms 미만 |
| TinyJev | 596M | — | 포인터 헤드, 임계값 판정을 전제로 한 캘리브레이션된 신뢰도 반환 |
| NanoJev | 0.6B | — | 한 번의 순전파로 전체 확률 분포, 학습 파이프라인·가중치·데이터셋 동봉 |
| Verdict | 118M | Apache-2.0 | 온도 스케일링 + split-conformal 기권 집합, 타입 지정 의사결정에서 Laya에 진다고 밝힘 |
| jevos | 1B (MiniCPM5를 17층으로 축소) | MIT | GGUF q4_k_m 619 MB, CPU에서 짧은 요청 54 ms / 긴 요청 220 ms |
| CLM | 8B | — | 지연 시간이 최대 9배 낮다고 보고 |
| Jebadiah | 27B / 9B / 4B | Apache-2.0 | bf16 / GGUF / MLX로 배포 |
검증할 만큼 구체적인 수치 몇 가지입니다.
- 1B CPU 구현(GGUF, 619 MB)은 짧은 요청에 54 ms, 긴 요청에 220 ms가 걸립니다. 호스팅 서비스는 344 / 345 ms입니다. 그러나 점수는 0.815 대 0.927이고, 예/아니오 질문에만 답합니다.
- 또 다른 오픈 가중치는 봉인된 판단 308건에서 33.1% 대 36.7%를 냅니다(약 13 ms).
- 전문가 양식 채우기 모델(706,048개 파라미터, 2.8 MB)은 자기 과제에서 99.7%에 도달하고 범용 모델은 83.6%를 냅니다. 저자들은 이것이 홈그라운드 이점이지 일반적인 승리가 아니라고 명시합니다.
이 표가 전달해야 하는 것은 순위가 아니라 규모입니다. “여섯 배 빠르지만 정확도는 열한 점 낮음”과 “정확도는 비슷하지만 질문 유형이 하나뿐”은 전혀 다른 트레이드오프이고, 둘 다 “로컬 대안”으로 서술될 수 있습니다.
규정 준수: 건너뛰면 안 되는 숫자
생태계가 붐비면 물어야 할 질문은 모두가 정말 같은 인터페이스를 지키는가입니다.
프로젝트 하나는 /v1/systemone의 의미를 검증 가능한 48개 요구사항으로 바꾸고(예를
들어, Choice의 선택지 확률은 정의상 합이 1이다. Score의 기댓값은 확률 가중 합과
같다. 선택지 수는 2에서 255까지다. 질문 순서가 바뀌어도 답이 변하지 않는다), 호환을
주장하는 모든 서버를 시험하는 스위트를 제공합니다.
측정 결과는 다음과 같습니다.
스타가 가장 많은 오픈 포트 여덟 개 중 완전히 규정을 준수한 것은 둘뿐이었다.
이는 양쪽으로 해석됩니다. 클라이언트에게는 “base URL만 바꾸면 된다”를 가정하지 말고 스위트로 확인해야 한다는 뜻입니다. 대안을 만드는 사람에게는 정확도보다 도달하기 쉽고 훨씬 덜 붐비는 차별화 축을 가리킵니다.
선택에 의미하는 바
종합하면, 무게 중심은 “어느 모델이 더 높은 점수를 내는가”에서 옮겨 갔습니다.
- 인터페이스는 공유되고 모델은 교체 가능합니다. 그 48개 요구사항이 교체 가능성의 정의입니다. 먼저 스위트로 확인하고, 그다음에 다른 것을 논하십시오.
- 해자는 모델 밖으로 옮겨 갔습니다. 모델 계층이 상품이 되면, 따라 하기 어려운 것은 인터페이스 계약 + 임계값 정책 + 자신의 데이터에 대한 캘리브레이션입니다. 이것들은 바로 이 가이드의 다른 페이지들이 다루는 것이고, 셋 다 벤더가 아니라 당신의 저장소에 있습니다.
- 정확도 격차를 올바른 좌표에 놓으십시오. “83.6% 대 99.7%“는 홈그라운드의 전문가이고, “0.815 대 0.927”은 예/아니오만 답하는 CPU의 작은 모델입니다. 두 쪽을 다 말하십시오. 그러지 않으면 표가 오도합니다.
생태계의 크기
생태계의 공개적인 발자취는 대략 1,100개 프로젝트입니다(2026년 9월).
양은 질도 성숙도도 아닙니다. 그 수에는 하나의 스캐폴드를 공유하는 단일 커밋
프로젝트가 아주 많습니다. 한 저자가 같은 날 저장소 묶음을 공개하며 AGENTS.md 하나,
단일 커밋 이력, 코드보다 훨씬 많은 산문을 공유하는 식입니다. 완전히 정당할 수도
있습니다 — 다만 검증되지 않았을 뿐입니다. “목록에 올랐는가”가 아니라 “실행할 수 있는
것이 있는가”로 거르십시오.
한 문장으로
모델 계층은 소모품이 되어 가고 있지만, 인터페이스와 임계값과 캘리브레이션은 그렇지 않습니다. 후자 셋에 힘을 쓰십시오. 첫째는 언제든 교체 가능합니다.