문서

FAQ

결정 모델이란 무엇입니까?

상태(텍스트, 이메일, 티켓, JSON 객체)와 타입이 지정된 질문을 읽고, 한 번의 포워드 패스로 각 질문에 대해 캘리브레이션된 확률이 담긴 타입 지정 답을 돌려주는 모델입니다. 텍스트를 생성하지는 않습니다. 그래서 빠르고, 출력을 활용하기도 쉽습니다. 티켓을 라우팅하고, 메시지를 차단하고, 확률이 임계값을 넘으면 에스컬레이션합니다.

어떻게 설치합니까?

macOS, Windows, Linux용 데스크톱 앱, Linux와 macOS의 명령줄에는 curl -fsSL https://ollaya.dev/install.sh | sh, Windows에는 irm https://ollaya.dev/install.ps1 | iex, 또는 Docker 이미지 ghcr.io/ollaya-dev/ollaya입니다. 다운로드를 참고하십시오.

Ollaya는 Ollama와 어떤 관계입니까?

Ollaya는 Ollama의 경험(단일 바이너리, pull, run, serve, Modelfile, 같은 관례의 로컬 REST API)을 가져와 생성 언어 모델이 아니라 결정 모델에 적용합니다. 독립 프로젝트이며 Ollama와 제휴하지 않았습니다.

Ollama도 이제 결정 모델을 실행합니다. Ollaya는 무엇이 다릅니까?

Ollama 0.35(2026년 9월)는 두 디코더 모델, Bespoke Labs의 Nimble과 Together AI의 Tev1을 위해 /v1/systemone을 추가했습니다. 두 프로젝트 모두 TypeSafe의 와이어 포맷을 따르고, 디코더 모델의 경우 둘 다 답 라벨의 다음 토큰 점수를 읽습니다. Ollaya도 0.8.0부터 Nimble을 실행합니다. 이 비교는 Ollama 0.35 대상입니다.

Ollaya Ollama 0.35
모델 16개 계열: 인코더(laya, nli, gliclass, von)와 디코더(winnow, clef, kev, decider, nimble, jeb, jeeves, cygnet 등) Nimble (9B)와 Tev1 (4B, 0.8B)
인코더 한 번의 포워드 패스로 모든 질문을 읽습니다. laya:en은 RTX 4090에서 8~10 ms에 다섯 질문에 답합니다 미지원
확률 각 모델에 적합된 온도로 캘리브레이션됩니다. Modelfile에서 직접 데이터로 다시 적합할 수 있습니다 원시 라벨 점수의 소프트맥스. Ollama는 confidence를 미캘리브레이션으로 문서화합니다
한계 TypeSafe의 것: 질문 1~256개, 선택지 2~255개, score 2~10단계 질문 1~64개, 선택지와 score 단계 2~26개, 요청 본문 64 KiB
API TypeSafe의 /v1/systemone, /v1/decisions, /v1/models; 라우팅과 소요 시간이 있는 /api/decide; MCP 서버 /v1/systemone
라우터 laya가 요청마다 영어 또는 다국어 모델을 고릅니다 없음
가중치 저자의 Hugging Face 저장소에서 수정 없이 받아 커밋에 고정하고 sha256으로 검증합니다 GGUF로 변환해 Ollama의 레지스트리에서 제공합니다

나란히 측정. RTX 5090 한 장에서 Bespoke Labs의 공개 벤치마크(13개 데이터셋의 사람이 라벨링한 질문 3,880개, Bespoke 자체 코드로 채점) 기준으로: Ollaya의 winnow:12b는 질문당 60 ms에 0.773이고, Ollama에서 가장 좋은 Nimble은 210 ms에 0.749입니다. 같은 Nimble 가중치에서 정확도는 같고(0.748과 0.749), 캘리브레이션 오차는 Ollaya에서 5.5배 낮으며(0.022 대 0.122, Ollaya가 저자의 온도를 적용하기 때문), Ollama가 더 빠릅니다(210 대 310 ms: Ollama는 Q8_0 GGUF를 실행하고 Ollaya는 fp32로 계산합니다). 홈페이지에 차트가 있습니다.

Ollama의 장점도 실재합니다. Tev1은 저기에 있고 여기에는 아직 없습니다(Together AI가 그 가중치의 라이선스를 공개하지 않았습니다). 이미 언어 모델에 Ollama를 쓴다면 데몬 하나로 둘 다 감당할 수 있습니다. 둘은 나란히 실행됩니다. Ollama는 포트 11434, Ollaya는 11435입니다.

TypeSafe와는 어떤 관계입니까?

TypeSafe의 폐쇄형 Jev 모델이 결정 모델이라는 범주를 열었습니다. Ollaya는 TypeSafe 호환 API 뒤에서 오픈 모델을 제공합니다. 공식 TypeSafe Python SDK 0.7.1은 TYPESAFE_BASE_URL=http://localhost:11435와 아무 API 키로 그대로 동작합니다. Ollaya는 TypeSafe와 제휴하지 않았습니다. TypeSafe 호환성을 참고하십시오.

어떤 모델을 실행할 수 있습니까?

이 계열들의 오픈 결정 모델입니다. 정확도와 속도를 비교한 Models를 참고하십시오.

  • winnow(EldanRing): Winnow-E4B(winnow:e4b, 권장 모델)와 Winnow-12B(winnow)로, GGUF 파일로 공개된 Gemma 4 파인튜닝입니다. Ollaya는 저자의 파일을 llama.cpp에서 NVIDIA GPU, Apple silicon의 GPU, 또는 CPU로 실행합니다. winnow:e4b는 타입 지정 결정에서 0.722로 Jev의 0.738에 가깝고, RTX 4090에서 약 90 ms입니다.
  • laya(Convai Innovations): laya(라우터), laya:en, laya:multilingual, laya:typed-decisions이며, 각각 -fp16과 -fp32도 있습니다. laya는 영어 텍스트를 laya:en으로, 다른 언어(예: 터키어)를 laya:multilingual로 보냅니다. 가장 빠릅니다.
  • decider(Mapika): decider:4b, decider:2b, decider:0.8b로 Qwen3.5 기반입니다. decider:4b는 타입 지정 결정에서 0.680입니다. decider:2b-vision은 상태와 함께 이미지도 읽습니다.
  • nli(Moritz Laurer): DeBERTa-v3-large와 ModernBERT-large 기반의 제로샷 NLI 분류기입니다. 가장 정확한 인코더입니다.
  • gliclass(Knowledgator): 지시를 따르는 제로샷 분류기로, 한 번에 모든 선택지를 채점합니다.
  • kev(Jared Palmer): kev:4b(kev), kev:0.8b, kev:9b로, Qwen3.5 위의 LoRA와 포인터 헤드가 각 선택지를 자기 스팬에서 채점하고 캘리브레이션됩니다. kev:9b는 타입 지정 결정에서 0.722로 winnow:e4b만큼이지만, 24 GB GPU가 필요하고 약 500 ms 걸립니다.
  • decision(vLLM Semantic Router 기여자): decision:eos, Decision 1.0 Eos로, 완전히 파인튜닝한 Qwen3.5-0.8B에 엔드포인트 헤드를 붙여 각 선택지를 마지막 토큰에서 채점하고 캘리브레이션하며, 최대 16,384 토큰 행을 다룹니다.
  • qwen3guard(Qwen 팀): 119개 언어의 안전 가드레일입니다. 내장 질문(안전, 논란, 위험, 그리고 위험 범주)에 스스로 답하므로 텍스트만 보냅니다.
  • von(Victor Hugo Panisa): ModernBERT-large 기반 Von 1.1로, 한 번에 각 선택지를 자기 마커에서 채점하고 최대 8,192 토큰의 상태를 읽습니다.
  • clm(Contrastive-LM): CLM-v0.1-8B로, Qwen3-8B로 상태와 각 선택지를 임베딩하고 학습된 두 헤드를 통해 상태에 가장 가까운 선택지를 고릅니다. 질문과 선택지는 캐시되므로 반복되는 것은 거의 공짜입니다. 타입 지정 결정에서 0.357입니다. 저자는 에이전트, 게임, 도구 호출 상태를 위해 만들었습니다.
  • jevk5(alibiserikbay): JevK5 v0.3으로, GGUF 파일로 공개된 Qwen3.5-4B 파인튜닝입니다. Ollaya는 저자의 4B Q8_0 파일을 llama.cpp에서 실행하며, 질문당 최대 16개 선택지입니다.

가중치는 어디서 옵니까?

모델 저자 자신의 Hugging Face 저장소에서 오며 커밋에 고정됩니다. 모든 파일은 받을 때 sha256으로 검증됩니다. Ollaya는 가중치를 다시 호스팅하지 않습니다. 그 레지스트리는 작은 매니페스트와 파생 파일(ONNX 그래프 등)만 제공하며, 그것들은 URL로 가중치를 참조합니다. 같은 파생 파일이 Hugging Face의 ollaya-dev 아래에 공개되어 있습니다.

답이 원래 모델과 같습니까?

Ollaya는 Laya를 ONNX로 실행합니다. 체크포인트당 2,383개 질문(en, multilingual, typed-decisions)에서 ONNX 내보내기는 PyTorch fp32 레퍼런스와 같은 답을 100% 선택했고, 확률 최대 차이는 1.1 × 10⁻⁴이었습니다. CUDA GPU에서는 기본으로 fp16 그래프가 실행됩니다. 근소한 차이에서는 fp32와 다를 수 있습니다. 레퍼런스와 맞추려면 -fp32 tag를 고정하십시오.

모델들은 Jev와 어떻게 비교됩니까?

모델에 따라 다릅니다. 타입 지정 결정(질문 2,000개)에서 winnow:e4b와 kev:9b가 가장 가깝고, 0.722 대 Jev의 0.738이며, winnow:e4b는 RTX 4090에서 다섯 질문에 약 90 ms로 답해 Jev의 호스팅 API보다 빠릅니다. laya 같은 작은 인코더는 가장 빠르지만 어려운 질문에서는 Jev에 크게 못 미칩니다. 홈페이지에 모든 모델의 정확도와 속도가 있습니다. 오픈 결정 모델과 Jev를 정확도와 캘리브레이션에서 독립적으로 비교한 것은 Decision Index를 참고하십시오. 고정된 작업에 라벨링된 데이터가 있다면, 그것으로 파인튜닝한 모델이 보통 어떤 범용 모델도 이깁니다.

얼마나 빠릅니까?

결정은 한 번의 포워드 패스입니다. RTX 4090에서 HTTP API를 통해 종단 간 측정하면, 질문 다섯 개의 중앙값 요청은 laya:multilingual로 8 ms, laya:en(fp16)으로 10 ms, gliclass로 15 ms, nli로 20 ms, winnow:e4b로 89 ms입니다. 질문 하나는 인코더에서 8–11 ms입니다. 더 큰 디코더는 더 오래 걸립니다. kev:4b 354 ms, decider:4b 520 ms입니다.

GPU가 필요합니까?

아니요. Ollaya는 CPU에서 실행되고, x86-64 Linux와 Windows에서는 NVIDIA GPU가 있고 드라이버가 R525 이상이면 그것을 씁니다(R580부터 CUDA 13 라이브러리, 그 전에는 CUDA 12). 설치 스크립트는 GPU를 찾았을 때만 CUDA 라이브러리를 내려받습니다. Windows와 Linux 데스크톱 앱은 CUDA 라이브러리를 포함하지 않습니다. 단독으로는 모델을 CPU에서 실행하고, 명령줄도 그 GPU 라이브러리와 함께 설치되어 있으면(그리고 앱만큼 최신이면), 앱은 그 설치에서 서버를 시작해 GPU를 씁니다. winnow 같은 GGUF 모델은 llama.cpp에서 실행되며, 이는 Apple silicon Mac의 GPU(Metal)도 씁니다. 그 동등성은 CUDA와 x86-64 CPU에서 확인했고, Metal에서는 아직입니다. 큰 언어 모델이므로 GPU는 인코더 모델보다 그들에게 훨씬 큰 차이를 만듭니다. 측정된 속도는 각 모델 페이지를 참고하십시오. RTX 30, 40, 50 시리즈 카드에서는 GGUF 모델에 더 필요한 것이 없습니다. 더 오래되었거나 데이터센터용 카드(GTX 10 시리즈, V100, T4, A100, H100)에서는 llama.cpp의 CUDA 라이브러리가 드라이버가 처음 사용할 때 컴파일하는 코드를 담고 있어 더 새 드라이버가 필요합니다. CUDA 12 라이브러리면 R570 이상, CUDA 13 라이브러리면 CUDA 13.4 이상의 드라이버입니다. 드라이버가 더 오래되면 Ollaya는 GGUF 모델을 CPU에서 실행하고 이유를 기록합니다. ollaya llama-devices는 각 GPU의 컴퓨트 능력과 커널이 그 위에서 실행되는지를 보여줍니다.

어떤 플랫폼을 지원합니까?

  • Linux glibc 2.38 이상의 x86-64와 ARM64: Ubuntu 24.04, Debian 13, Fedora 39, RHEL 10 이상.
  • macOS Apple silicon에서 14 이상. laya와 nli:modernbert-large는 MLX를 통해 Apple GPU에서 실행되어 CPU보다 2–3배 빠릅니다. 다른 모델은 CPU에서 실행됩니다.
  • Docker: linux/amd64와 linux/arm64에는 ghcr.io/ollaya-dev/ollaya, NVIDIA GPU에는 :cuda(R580보다 오래된 호스트 드라이버에는 :cuda12). 더 오래된 Linux 배포판에서도 사용하십시오.
  • Windows 64비트 x86 PC의 10과 11: 데스크톱 앱, 명령줄에는 irm https://ollaya.dev/install.ps1 | iex이며, 이는 NVIDIA GPU도 씁니다(둘 다 설치하면 앱의 서버도 그것을 씁니다). Linux 설치 프로그램을 쓰는 WSL 2도 동작합니다.
  • 데스크톱 앱은 세 곳 모두에서 실행됩니다. 다운로드를 참고하십시오.

제 데이터가 제 머신을 떠납니까?

아니요. 서버는 기본으로 127.0.0.1:11435에서 수신하고 모델을 로컬에서 실행합니다. 네트워크는 모델을 받는 데만 쓰입니다. 상태와 질문은 절대 기록되지 않습니다.

왜 포트 11435입니까?

Ollama의 기본 포트 11434 옆에 있어 둘이 나란히 실행될 수 있습니다.

확률은 어떻게 캘리브레이션됩니까?

질문 유형과 선택지 수별 온도 스케일링으로, 각 모델에 딸려 옵니다. 의존하는 임계값에 대해서는 직접 라벨링한 데이터로 온도를 다시 적합하고 Modelfile로 구워 넣으십시오.

MCP 서버나 에이전트 스킬이 있습니까?

둘 다 있습니다. ollaya mcp는 로컬 모델을 Claude Code, Claude Desktop, Cursor 및 기타 MCP 클라이언트에 제공하고(claude mcp add ollaya -- ollaya mcp), ollaya-decisions 스킬은 에이전트에게 언제 어떻게 그것을 쓸지 가르칩니다. Agents를 참고하십시오.

어떻게 업데이트합니까?

ollaya update를 실행하십시오. 최신 릴리스를 확인하고, 더 새 것이 있으면 설치 스크립트를 같은 위치에 다시 실행해 모델과 서비스 설정을 유지합니다. ollaya update --check는 업데이트가 있는지만 알려줍니다. 데스크톱 앱은 통째로 업데이트됩니다. 다운로드에서 새 버전을 설치하십시오. Docker에서는 새 이미지를 받으십시오.

어떻게 제거합니까?

Linux에서, 설치 프로그램이 서비스를 설정한 뒤:

sudo systemctl disable --now ollaya && sudo rm /etc/systemd/system/ollaya.service
sudo rm -rf /usr/local/bin/ollaya /usr/local/lib/ollaya /usr/local/share/doc/ollaya /usr/local/share/ollaya
sudo userdel -r ollaya    # also deletes /usr/share/ollaya, including the models

root 없는 설치(~/.local)라면 ~/.local/bin/ollaya, ~/.local/lib/ollaya, ~/.local/share/doc/ollaya, ~/.local/share/ollaya, 그리고 ~/.ollaya의 모델을 삭제하십시오.

라이선스는 무엇입니까?

Ollaya는 Apache-2.0입니다. 모델은 각자의 라이선스를 가집니다. laya, decider, kev, decision, qwen3guard, gliclass, von, winnow, jevk5, clm, nli:modernbert-large는 Apache-2.0이고, nli:deberta-v3-large는 MIT입니다.