ドキュメント

FAQ

意思決定モデルとは何ですか?

状態(テキスト、メール、チケット、JSON オブジェクト)と型付きの質問を読み、1 回のフォワードパスで各質問に対する較正済みの確率を備えた型付きの答えを返すモデルです。テキストを生成することはありません。そのため高速で、出力も扱いやすいものです。チケットをルーティングし、メッセージをブロックし、確率がしきい値を超えたらエスカレーションします。

どうやってインストールしますか?

macOS、Windows、Linux 向けのデスクトップアプリ、Linux と macOS のコマンドラインには curl -fsSL https://ollaya.dev/install.sh | sh、Windows には irm https://ollaya.dev/install.ps1 | iex、または Docker イメージ ghcr.io/ollaya-dev/ollaya です。ダウンロードを参照してください。

Ollaya は Ollama とどういう関係ですか?

Ollaya は Ollama の体験(単一バイナリ、pull、run、serve、Modelfile、同じ作法のローカル REST API)を取り入れ、それを生成言語モデルではなく意思決定モデルに適用します。独立したプロジェクトであり、Ollama とは提携していません。

Ollama も意思決定モデルを動かせるようになりました。Ollaya は何が違いますか?

Ollama 0.35(2026 年 9 月)は 2 つのデコーダモデル、Bespoke Labs の Nimble と Together AI の Tev1 のために /v1/systemone を追加しました。両プロジェクトとも TypeSafe のワイヤフォーマットに従い、デコーダモデルではどちらも回答ラベルの次トークンのスコアを読みます。Ollaya も 0.8.0 以降 Nimble を動かせます。この比較は Ollama 0.35 とのものです。

Ollaya Ollama 0.35
モデル 16 のファミリー:エンコーダ(laya、nli、gliclass、von)とデコーダ(winnow、clef、kev、decider、nimble、jeb、jeeves、cygnet など) Nimble (9B) と Tev1 (4B, 0.8B)
エンコーダ 1 回のフォワードパスですべての質問を読みます。laya:en は RTX 4090 で 8–10 ms に 5 つの質問に答えます 非対応
確率 各モデルにフィットした温度で較正されます。自分のデータで Modelfile の中で再フィットできます 生のラベルスコアのソフトマックス。Ollama は confidence を未較正と記しています
制限 TypeSafe のもの:1–256 の質問、2–255 の選択肢、2–10 の score レベル 1–64 の質問、2–26 の選択肢と score レベル、64 KiB のリクエスト本文
API TypeSafe の /v1/systemone、/v1/decisions、/v1/models;ルーティングと所要時間つきの /api/decide;MCP サーバー /v1/systemone
ルーター laya がリクエストごとに英語か多言語のモデルを選びます なし
重み 著者の Hugging Face リポジトリから改変なしで取得し、コミットに固定して sha256 で検証します GGUF に変換し、Ollama のレジストリから提供します

並べて計測。 1 枚の RTX 5090 で、Bespoke Labs の公開ベンチマーク(13 データセットの 3,880 の人手ラベル付き質問、Bespoke 自身のコードで採点)において:Ollaya の winnow:12b は質問あたり 60 ms で 0.773、Ollama で最高の Nimble は 210 ms で 0.749 です。同じ Nimble の重みでは精度は同じで(0.748 と 0.749)、較正誤差は Ollaya で 5.5 倍低く(0.022 対 0.122、Ollaya が著者の温度を適用するため)、Ollama のほうが高速です(210 対 310 ms:Ollama は Q8_0 GGUF を動かし、Ollaya は fp32 で計算します)。ホームページにグラフがあります。

Ollama の利点も確かなものです。Tev1 はあちらにあり、こちらにはまだありません(Together AI がその重みのライセンスを公開していないため)。すでに言語モデルに Ollama を使っているなら、1 つのデーモンで両方をまかなえます。両者は並んで動きます:Ollama はポート 11434、Ollaya は 11435 です。

TypeSafe とはどういう関係ですか?

TypeSafe のクローズドな Jev モデルが意思決定モデルというカテゴリを生みました。Ollaya は TypeSafe 互換 API の背後でオープンなモデルを提供します。公式の TypeSafe Python SDK 0.7.1 は TYPESAFE_BASE_URL=http://localhost:11435 と任意の API キーでそのまま動作します。Ollaya は TypeSafe と提携していません。TypeSafe 互換性を参照してください。

どんなモデルを動かせますか?

これらのファミリーのオープンな意思決定モデルです。Models を参照してください。精度と速度を比較しています。

  • winnow(EldanRing):Winnow-E4B(winnow:e4b、推奨モデル)と Winnow-12B(winnow)で、GGUF ファイルとして公開された Gemma 4 のファインチューニングです。Ollaya は著者のファイルを llama.cpp 上で、NVIDIA GPU、Apple silicon の GPU、または CPU で動かします。winnow:e4b は型付き意思決定で 0.722、Jev の 0.738 に近く、RTX 4090 で約 90 ms です。
  • laya(Convai Innovations):laya(ルーター)、laya:en、laya:multilingual、laya:typed-decisions で、それぞれ -fp16 と -fp32 もあります。laya は英語のテキストを laya:en に、他の言語(たとえばトルコ語)を laya:multilingual に送ります。最も高速です。
  • decider(Mapika):decider:4b、decider:2b、decider:0.8b で、Qwen3.5 をベースにしています。decider:4b は型付き意思決定で 0.680 です。decider:2b-vision は状態と一緒に画像も読みます。
  • nli(Moritz Laurer):DeBERTa-v3-large と ModernBERT-large 上のゼロショット NLI 分類器です。最も精度の高いエンコーダです。
  • gliclass(Knowledgator):指示に従うゼロショット分類器で、1 回ですべての選択肢を採点します。
  • kev(Jared Palmer):kev:4b(kev)、kev:0.8b、kev:9b で、Qwen3.5 上の LoRA とポインタヘッドが各選択肢をそのスパンで採点し、較正されます。kev:9b は型付き意思決定で 0.722 と winnow:e4b に匹敵しますが、24 GB の GPU が必要で約 500 ms かかります。
  • decision(vLLM Semantic Router の貢献者):decision:eos、Decision 1.0 Eos で、完全にファインチューニングした Qwen3.5-0.8B にエンドポイントヘッドを付け、各選択肢を最後のトークンで採点し、較正され、最大 16,384 トークンの行を扱えます。
  • qwen3guard(Qwen チーム):119 言語の安全ガードレールです。組み込みの質問(安全、議論を呼ぶ、危険、および危険カテゴリ)に自分で答えるので、テキストだけを送ります。
  • von(Victor Hugo Panisa):ModernBERT-large 上の Von 1.1 で、1 回で各選択肢をそのマーカーで採点し、最大 8,192 トークンの状態を読みます。
  • clm(Contrastive-LM):CLM-v0.1-8B で、Qwen3-8B で状態と各選択肢を埋め込み、学習済みの 2 つのヘッドを通して状態に最も近い選択肢を選びます。質問と選択肢はキャッシュされるので、繰り返しはほぼ無料です。型付き意思決定で 0.357 です。著者はエージェント、ゲーム、ツール呼び出しの状態のために作りました。
  • jevk5(alibiserikbay):JevK5 v0.3 で、GGUF ファイルとして公開された Qwen3.5-4B のファインチューニングです。Ollaya は著者の 4B Q8_0 ファイルを llama.cpp 上で動かし、質問あたり最大 16 の選択肢です。

重みはどこから来ますか?

モデル著者自身の Hugging Face リポジトリからで、コミットに固定されています。各ファイルは取得時に sha256 で検証されます。Ollaya が重みを再ホストすることはありません。そのレジストリは小さなマニフェストと派生ファイル(ONNX グラフなど)だけを提供し、それらは URL で重みを参照します。同じ派生ファイルは Hugging Face の ollaya-dev の下に公開されています。

答えは元のモデルと同じですか?

Ollaya は Laya を ONNX として動かします。チェックポイントごとに 2,383 の質問(en、multilingual、typed-decisions)で、ONNX エクスポートは PyTorch fp32 リファレンスと同じ答えを 100% の割合で選び、確率の最大差は 1.1 × 10⁻⁴ でした。CUDA GPU では既定で fp16 グラフが動きます。僅差では fp32 と異なることがあります。リファレンスに合わせるには -fp32 タグを固定してください。

Jev と比べてどうですか?

モデル次第です。型付き意思決定(2,000 の質問)では winnow:e4b と kev:9b が最も近く、0.722 対 Jev の 0.738 で、winnow:e4b は RTX 4090 で 5 つの質問に約 90 ms で答え、Jev のホスト型 API より高速です。laya のような小さなエンコーダは最速ですが、難しい質問では Jev に大きく及びません。ホームページに全モデルの精度と速度があります。オープンな意思決定モデルと Jev を精度と較正で独立に比較したものは Decision Index を参照してください。固定のタスクのラベル付きデータがあれば、それでファインチューニングしたモデルが通常はどんな汎用モデルにも勝ります。

どれくらい速いですか?

意思決定は 1 回のフォワードパスです。RTX 4090 で HTTP API を通して端から端まで計測すると、5 つの質問がある中央値のリクエストは laya:multilingual で 8 ms、laya:en(fp16)で 10 ms、gliclass で 15 ms、nli で 20 ms、winnow:e4b で 89 ms です。1 つの質問はエンコーダで 8–11 ms です。大きなデコーダはより長くかかります:kev:4b 354 ms、decider:4b 520 ms。

GPU は必要ですか?

いいえ。Ollaya は CPU で動き、x86-64 の Linux と Windows では、NVIDIA GPU がありドライバが R525 以降であればそれを使います(R580 以降は CUDA 13 ライブラリ、それ以前は CUDA 12)。インストールスクリプトは GPU を見つけたときにだけ CUDA ライブラリをダウンロードします。Windows と Linux のデスクトップアプリは CUDA ライブラリを同梱しません。単体ではモデルを CPU で動かし、コマンドラインもその GPU ライブラリとともにインストールされている場合(かつアプリと同じくらい新しい場合)、アプリはそのインストールからサーバーを起動し、GPU を使います。winnow のような GGUF モデルは llama.cpp 上で動き、これは Apple silicon Mac の GPU(Metal)も使います。それらの同等性は CUDA と x86-64 CPU で確認済みで、Metal ではまだです。大規模言語モデルなので、GPU はエンコーダモデルよりもはるかに大きな差を生みます。実測速度は各モデルのページを参照してください。RTX 30、40、50 シリーズのカードでは、GGUF モデルに追加のものは要りません。より古いカードやデータセンター向けカード(GTX 10 シリーズ、V100、T4、A100、H100)では、llama.cpp の CUDA ライブラリがドライバによって初回使用時にコンパイルされるコードを含み、より新しいドライバが必要です:CUDA 12 ライブラリなら R570 以降、CUDA 13 ライブラリなら CUDA 13.4 以降のドライバです。ドライバが古い場合、Ollaya は GGUF モデルを CPU で動かし、理由をログに記録します。ollaya llama-devices は各 GPU の計算能力とカーネルがそこで動くかどうかを表示します。

どのプラットフォームに対応していますか?

  • Linux x86-64 と ARM64、glibc 2.38 以降:Ubuntu 24.04、Debian 13、Fedora 39、RHEL 10 以降。
  • macOS Apple silicon 上の 14 以降。laya と nli:modernbert-large は MLX を通して Apple GPU で動き、CPU より 2–3 倍高速です。他のモデルは CPU で動きます。
  • Docker: linux/amd64 と linux/arm64 には ghcr.io/ollaya-dev/ollaya、NVIDIA GPU には :cuda(R580 より古いホストドライバには :cuda12)。より古い Linux ディストリビューションでも使えます。
  • Windows 64 ビット x86 PC 上の 10 と 11:デスクトップアプリ、コマンドラインには irm https://ollaya.dev/install.ps1 | iex、これも NVIDIA GPU を使います(両方インストールすると、アプリのサーバーもそれを使います)。Linux インストーラを使う WSL 2 でも動作します。
  • デスクトップアプリは 3 つすべてで動きます:ダウンロードを参照してください。

データはマシンの外に出ますか?

いいえ。サーバーは既定で 127.0.0.1:11435 で待ち受け、モデルをローカルで動かします。ネットワークはモデルの取得にだけ使われます。状態と質問が記録されることはありません。

なぜポート 11435 ですか?

Ollama の既定のポート 11434 の隣にあり、両者が並んで動けるようにしています。

確率はどう較正されますか?

質問タイプと選択肢の数ごとの温度スケーリングで、各モデルに付属します。依存するしきい値については、自分のラベル付きデータで温度を再フィットし、Modelfile で焼き込んでください。

MCP サーバーやエージェントスキルはありますか?

どちらもあります。ollaya mcp はローカルモデルを Claude Code、Claude Desktop、Cursor、その他の MCP クライアントに提供し(claude mcp add ollaya -- ollaya mcp)、ollaya-decisions スキルはエージェントに、いつどのように使うかを教えます。Agentsを参照してください。

どうやって更新しますか?

ollaya update を実行します。最新リリースを確認し、より新しいものがあれば、インストールスクリプトを同じ場所にもう一度実行し、モデルとサービスの設定を保ちます。ollaya update --check は更新があるかどうかだけを伝えます。デスクトップアプリはまとめて更新されます:ダウンロードから新しいバージョンをインストールしてください。Docker では、新しいイメージを取得します。

どうやってアンインストールしますか?

Linux で、インストーラがサービスを設定した後:

sudo systemctl disable --now ollaya && sudo rm /etc/systemd/system/ollaya.service
sudo rm -rf /usr/local/bin/ollaya /usr/local/lib/ollaya /usr/local/share/doc/ollaya /usr/local/share/ollaya
sudo userdel -r ollaya    # also deletes /usr/share/ollaya, including the models

root なしのインストール(~/.local)では、~/.local/bin/ollaya、~/.local/lib/ollaya、~/.local/share/doc/ollaya、~/.local/share/ollaya、および ~/.ollaya のモデルを削除します。

ライセンスは何ですか?

Ollaya は Apache-2.0 です。モデルはそれぞれ独自のライセンスを持ちます:laya、decider、kev、decision、qwen3guard、gliclass、von、winnow、jevk5、clm、nli:modernbert-large は Apache-2.0、nli:deberta-v3-large は MIT です。