Документация

Часто задаваемые вопросы

Что такое модель решений?

Модель, которая читает состояние (текст, письмо, тикет, объект JSON) вместе с типизированными вопросами и за один прямой проход возвращает типизированный ответ с калиброванными вероятностями для каждого вопроса. Она никогда не генерирует текст. Это делает её быстрой, а её вывод — удобным для действий: маршрутизировать тикет, заблокировать сообщение, эскалировать, когда вероятность выше порога.

Как её установить?

Десктопное приложение для macOS, Windows и Linux; curl -fsSL https://ollaya.dev/install.sh | sh для командной строки в Linux и macOS, irm https://ollaya.dev/install.ps1 | iex в Windows; или образ Docker ghcr.io/ollaya-dev/ollaya. См. Скачать.

Как Ollaya связана с Ollama?

Ollaya заимствует у Ollama опыт работы (один бинарный файл, pull, run, serve, Modelfiles, локальный REST API с теми же соглашениями) и применяет его к моделям решений, а не к генеративным языковым моделям. Это независимый проект, не связанный с Ollama.

Теперь Ollama тоже запускает модели решений. Чем Ollaya отличается?

Ollama 0.35 (сентябрь 2026) добавила /v1/systemone для двух декодерных моделей — Nimble от Bespoke Labs и Tev1 от Together AI. Оба проекта следуют сетевому формату TypeSafe, и для декодерных моделей оба читают оценки следующего токена по меткам ответа. Ollaya тоже запускает Nimble, начиная с 0.8.0. Это сравнение — с Ollama 0.35:

Ollaya Ollama 0.35
Модели 16 семейств: энкодеры (laya, nli, gliclass, von) и декодеры (winnow, clef, kev, decider, nimble, jeb, jeeves, cygnet и другие) Nimble (9B) и Tev1 (4B, 0.8B)
Энкодеры Читают все вопросы за один прямой проход. laya:en отвечает на пять вопросов за 8–10 мс на RTX 4090 Не поддерживается
Вероятности Калибруются подобранными для каждой модели температурами, которые вы можете переподобрать на своих данных в Modelfile Softmax по сырым оценкам меток. Ollama описывает confidence как некалиброванную
Ограничения От TypeSafe: от 1 до 256 вопросов, от 2 до 255 вариантов, от 2 до 10 уровней score От 1 до 64 вопросов, от 2 до 26 вариантов и уровней, тело запроса 64 КиБ
API От TypeSafe: /v1/systemone, /v1/decisions и /v1/models; /api/decide с маршрутизацией и таймингами; сервер MCP /v1/systemone
Router laya выбирает английскую или многоязычную модель для каждого запроса Нет
Веса Загружаются без изменений из репозитория автора на Hugging Face, привязаны к коммиту и проверены по sha256 Преобразованы в GGUF и отдаются из реестра Ollama

Измерено бок о бок. На одной RTX 5090, на публичном бенчмарке Bespoke Labs (3 880 размеченных людьми вопросов из 13 датасетов, оценённых их собственным кодом): winnow:12b на Ollaya набирает 0.773 при 60 мс на вопрос против 0.749 при 210 мс у Nimble на Ollama, лучшего у Ollama. На одних и тех же весах Nimble точность одинакова (0.748 и 0.749), ошибка калибровки в 5.5 раза ниже на Ollaya (0.022 против 0.122, потому что Ollaya применяет температуру автора), а Ollama быстрее (210 против 310 мс: она выполняет GGUF Q8_0, тогда как Ollaya считает в fp32). Домашняя страница содержит график.

У Ollama тоже есть настоящие преимущества. Tev1 у неё есть, а здесь пока нет (Together AI ещё не опубликовала лицензию на свои веса), и если вы уже используете Ollama для языковых моделей, один демон покрывает и то и другое. Обе работают бок о бок: Ollama на порту 11434, Ollaya на 11435.

Как она связана с TypeSafe?

Закрытая модель Jev от TypeSafe создала категорию моделей решений. Ollaya отдаёт открытые модели через API, совместимый с TypeSafe: официальный Python SDK TypeSafe 0.7.1 работает без изменений с TYPESAFE_BASE_URL=http://localhost:11435 и любым API key. Ollaya не связана с TypeSafe. См. Совместимость с TypeSafe.

Какие модели я могу запускать?

Открытые модели решений из этих семейств. См. Models, где сравниваются их точность и скорость.

  • winnow от EldanRing: Winnow-E4B (winnow:e4b, рекомендуемая модель) и Winnow-12B (winnow), дообученные Gemma 4, опубликованные как GGUF-файлы. Ollaya запускает файл автора на llama.cpp, на GPU NVIDIA, GPU Apple silicon или CPU. winnow:e4b набирает 0.722 на типизированных решениях, близко к 0.738 у Jev, примерно за 90 мс на RTX 4090.
  • laya от Convai Innovations: laya (router), laya:en, laya:multilingual и laya:typed-decisions, каждая также как -fp16 и -fp32. laya отправляет английский текст в laya:en, а другие языки, например турецкий, — в laya:multilingual. Она самая быстрая.
  • decider от Mapika: decider:4b, decider:2b и decider:0.8b, построенные на Qwen3.5. decider:4b набирает 0.680 на типизированных решениях. decider:2b-vision также читает изображение вместе с состоянием.
  • nli от Moritz Laurer: классификаторы NLI zero-shot на DeBERTa-v3-large и ModernBERT-large. Это самый точный энкодер.
  • gliclass от Knowledgator: следующий инструкциям классификатор zero-shot, который оценивает каждый вариант за один проход.
  • kev от Jared Palmer: kev:4b (kev), kev:0.8b и kev:9b, LoRA и указательная голова на Qwen3.5, которые оценивают каждый вариант на его собственном span, с калибровкой. kev:9b набирает 0.722 на типизированных решениях, столько же, сколько winnow:e4b, но требует GPU на 24 ГБ и занимает около 500 мс.
  • decision от участников vLLM Semantic Router: decision:eos, Decision 1.0 Eos, полностью дообученная Qwen3.5-0.8B с головой-эндпоинтом, которая оценивает каждый вариант на его последнем токене, с калибровкой, со строками до 16 384 токенов.
  • qwen3guard от команды Qwen: ограничитель безопасности на 119 языках. Он отвечает на свои встроенные вопросы (безопасно, спорно или небезопасно, а также категория небезопасного), поэтому вы отправляете ему только текст.
  • von от Victor Hugo Panisa: Von 1.1 на ModernBERT-large, который оценивает каждый вариант на его собственном маркере за один проход и читает состояния до 8 192 токенов.
  • clm от Contrastive-LM: CLM-v0.1-8B, который встраивает состояние и каждый вариант с помощью Qwen3-8B и выбирает вариант, ближайший к состоянию, через две обученные головы. Вопросы и варианты кэшируются, поэтому повторяющиеся почти ничего не стоят. Она набирает 0.357 на типизированных решениях; авторы сделали её для состояний агентов, игр и вызова инструментов.
  • jevk5 от alibiserikbay: JevK5 v0.3, дообученная Qwen3.5-4B, опубликованная как GGUF-файлы. Ollaya запускает 4B Q8_0 файл автора на llama.cpp, с максимум 16 вариантами на вопрос.

Откуда берутся веса?

Из собственных репозиториев авторов моделей на Hugging Face, привязанных к коммиту. Каждый файл проверяется по его sha256 при загрузке. Ollaya никогда не перехостит веса: её реестр отдаёт только небольшие манифесты и производные файлы, например графы ONNX, которые ссылаются на веса по URL. Те же производные файлы опубликованы на Hugging Face под ollaya-dev.

Совпадают ли ответы с ответами исходной модели?

Ollaya запускает Laya как ONNX. На 2 383 вопросах на каждый чекпойнт (en, multilingual и typed-decisions) экспорт ONNX выбирал тот же ответ, что и эталон PyTorch fp32, в 100% случаев, при максимальной разнице вероятностей 1.1 × 10⁻⁴. На GPU CUDA по умолчанию работает граф fp16; он может отличаться от fp32 при близких результатах. Зафиксируйте тег -fp32, чтобы совпасть с эталоном.

Как модели соотносятся с Jev?

Зависит от модели. На типизированных решениях (2 000 вопросов) ближе всех winnow:e4b и kev:9b — 0.722 против 0.738 у Jev, — а winnow:e4b отвечает на пять вопросов примерно за 90 мс на RTX 4090, быстрее, чем хостинговый API Jev. Небольшие энкодеры, такие как laya, самые быстрые, но на сложных вопросах сильно уступают Jev. Домашняя страница перечисляет точность и скорость каждой модели. Об независимом сравнении открытых моделей решений с Jev по точности и калибровке см. Decision Index. Если у вас есть размеченные данные для фиксированной задачи, дообученная на них модель обычно превосходит любую общую.

Насколько это быстро?

Решение — это один прямой проход. Измерено сквозным образом через HTTP API на RTX 4090: медианный запрос с пятью вопросами занимает 8 мс с laya:multilingual и 10 мс с laya:en (fp16), 15 мс с gliclass, 20 мс с nli и 89 мс с winnow:e4b. Один вопрос занимает 8–11 мс на энкодерах. Более крупные декодеры занимают больше: kev:4b 354 мс, decider:4b 520 мс.

Нужна ли мне GPU?

Нет. Ollaya работает на CPU, а в x86-64 Linux и Windows использует GPU NVIDIA с драйвером R525 или новее, когда он есть (библиотеки CUDA 13 начиная с R580, до этого CUDA 12). Установочные скрипты скачивают библиотеки CUDA, только когда находят GPU. Десктопные приложения для Windows и Linux не включают библиотеки CUDA: сами по себе они запускают модели на CPU, а когда командная строка тоже установлена вместе с её GPU-библиотеками (и не старше приложения), приложение запускает сервер из той установки, который использует GPU. Модели GGUF, такие как winnow, работают на llama.cpp, который также использует GPU у Mac на Apple silicon (Metal); их паритет проверен на CUDA и на x86-64 CPU, но пока не на Metal. Это большие языковые модели, поэтому GPU даёт для них гораздо больше, чем для моделей-энкодеров: измеренные скорости смотрите на странице каждой модели. На картах серий RTX 30, 40 или 50 моделям GGUF больше ничего не нужно. На более старых картах или картах для дата-центров (серия GTX 10, V100, T4, A100, H100) библиотеки CUDA от llama.cpp несут код, который драйвер компилирует при первом использовании, а для этого нужен более новый драйвер: R570 или новее с библиотеками CUDA 12 и драйвер для CUDA 13.4 или новее с библиотеками CUDA 13. С более старым драйвером Ollaya запускает модели GGUF на CPU и пишет в журнал, почему; ollaya llama-devices показывает вычислительную способность каждого GPU и то, выполняются ли на нём ядра.

Какие платформы поддерживаются?

  • Linux x86-64 и ARM64 с glibc 2.38 или новее: Ubuntu 24.04, Debian 13, Fedora 39, RHEL 10 или новее.
  • macOS 14 или новее на Apple silicon. laya и nli:modernbert-large работают на GPU Apple через MLX, в 2–3 раза быстрее, чем на CPU; остальные модели работают на CPU.
  • Docker: ghcr.io/ollaya-dev/ollaya для linux/amd64 и linux/arm64, а :cuda для GPU NVIDIA (:cuda12 для драйверов хоста старше R580). Используйте его и на более старых дистрибутивах Linux.
  • Windows 10 и 11 на 64-битных ПК x86: десктопное приложение, а для командной строки irm https://ollaya.dev/install.ps1 | iex, который тоже использует GPU NVIDIA (установите оба, и сервер приложения тоже будет его использовать). WSL 2 с установщиком для Linux тоже работает.
  • Десктопное приложение работает на всех трёх: см. Скачать.

Покидают ли мои данные мою машину?

Нет. Сервер по умолчанию слушает 127.0.0.1:11435 и запускает модели локально. Сеть используется только для загрузки моделей. Состояния и вопросы никогда не записываются в журнал.

Почему порт 11435?

Он стоит рядом со стандартным портом Ollama, 11434, так что обе могут работать бок о бок.

Как калибруются вероятности?

Масштабированием по температуре отдельно для каждого типа вопроса и числа вариантов, которое поставляется с каждой моделью. Для порогов, на которые вы полагаетесь, переподберите температуры на своих размеченных данных и запеките их через Modelfile.

Есть ли сервер MCP или навык для агентов?

И то и другое. ollaya mcp отдаёт локальные модели Claude Code, Claude Desktop, Cursor и другим клиентам MCP (claude mcp add ollaya -- ollaya mcp), а навык ollaya-decisions учит агентов, когда и как их использовать. См. Agents.

Как её обновить?

Запустите ollaya update. Он проверяет последний выпуск и, если есть более новый, снова запускает установочный скрипт в то же место, что сохраняет ваши модели и настройки службы. ollaya update --check только сообщает, есть ли обновление. Десктопное приложение обновляется целиком: установите новую версию из Скачать. В Docker загрузите новый образ.

Как её удалить?

В Linux, после того как установщик настроил службу:

sudo systemctl disable --now ollaya && sudo rm /etc/systemd/system/ollaya.service
sudo rm -rf /usr/local/bin/ollaya /usr/local/lib/ollaya /usr/local/share/doc/ollaya /usr/local/share/ollaya
sudo userdel -r ollaya    # also deletes /usr/share/ollaya, including the models

Для установки без root (в ~/.local) удалите ~/.local/bin/ollaya, ~/.local/lib/ollaya, ~/.local/share/doc/ollaya и ~/.local/share/ollaya, а также модели в ~/.ollaya.

Какая лицензия?

Ollaya — Apache-2.0. У моделей свои лицензии: laya, decider, kev, decision, qwen3guard, gliclass, von, winnow, jevk5, clm и nli:modernbert-large — Apache-2.0, а nli:deberta-v3-large — MIT.