Часто задаваемые вопросы
Что такое модель решений?
Модель, которая читает состояние (текст, письмо, тикет, объект JSON) вместе с типизированными вопросами и за один прямой проход возвращает типизированный ответ с калиброванными вероятностями для каждого вопроса. Она никогда не генерирует текст. Это делает её быстрой, а её вывод — удобным для действий: маршрутизировать тикет, заблокировать сообщение, эскалировать, когда вероятность выше порога.
Как её установить?
Десктопное приложение для macOS, Windows и Linux; curl -fsSL https://ollaya.dev/install.sh | sh для командной строки в Linux и macOS, irm https://ollaya.dev/install.ps1 | iex в Windows; или образ Docker ghcr.io/ollaya-dev/ollaya. См. Скачать.
Как Ollaya связана с Ollama?
Ollaya заимствует у Ollama опыт работы (один бинарный файл, pull, run, serve, Modelfiles, локальный REST API с теми же соглашениями) и применяет его к моделям решений, а не к генеративным языковым моделям. Это независимый проект, не связанный с Ollama.
Теперь Ollama тоже запускает модели решений. Чем Ollaya отличается?
Ollama 0.35 (сентябрь 2026) добавила /v1/systemone для двух декодерных моделей — Nimble от Bespoke Labs и Tev1 от Together AI. Оба проекта следуют сетевому формату TypeSafe, и для декодерных моделей оба читают оценки следующего токена по меткам ответа. Ollaya тоже запускает Nimble, начиная с 0.8.0. Это сравнение — с Ollama 0.35:
| Ollaya | Ollama 0.35 | |
|---|---|---|
| Модели | 16 семейств: энкодеры (laya, nli, gliclass, von) и декодеры (winnow, clef, kev, decider, nimble, jeb, jeeves, cygnet и другие) |
Nimble (9B) и Tev1 (4B, 0.8B) |
| Энкодеры | Читают все вопросы за один прямой проход. laya:en отвечает на пять вопросов за 8–10 мс на RTX 4090 |
Не поддерживается |
| Вероятности | Калибруются подобранными для каждой модели температурами, которые вы можете переподобрать на своих данных в Modelfile | Softmax по сырым оценкам меток. Ollama описывает confidence как некалиброванную |
| Ограничения | От TypeSafe: от 1 до 256 вопросов, от 2 до 255 вариантов, от 2 до 10 уровней score | От 1 до 64 вопросов, от 2 до 26 вариантов и уровней, тело запроса 64 КиБ |
| API | От TypeSafe: /v1/systemone, /v1/decisions и /v1/models; /api/decide с маршрутизацией и таймингами; сервер MCP |
/v1/systemone |
| Router | laya выбирает английскую или многоязычную модель для каждого запроса |
Нет |
| Веса | Загружаются без изменений из репозитория автора на Hugging Face, привязаны к коммиту и проверены по sha256 | Преобразованы в GGUF и отдаются из реестра Ollama |
Измерено бок о бок. На одной RTX 5090, на публичном бенчмарке Bespoke Labs (3 880 размеченных людьми вопросов из 13 датасетов, оценённых их собственным кодом): winnow:12b на Ollaya набирает 0.773 при 60 мс на вопрос против 0.749 при 210 мс у Nimble на Ollama, лучшего у Ollama. На одних и тех же весах Nimble точность одинакова (0.748 и 0.749), ошибка калибровки в 5.5 раза ниже на Ollaya (0.022 против 0.122, потому что Ollaya применяет температуру автора), а Ollama быстрее (210 против 310 мс: она выполняет GGUF Q8_0, тогда как Ollaya считает в fp32). Домашняя страница содержит график.
У Ollama тоже есть настоящие преимущества. Tev1 у неё есть, а здесь пока нет (Together AI ещё не опубликовала лицензию на свои веса), и если вы уже используете Ollama для языковых моделей, один демон покрывает и то и другое. Обе работают бок о бок: Ollama на порту 11434, Ollaya на 11435.
Как она связана с TypeSafe?
Закрытая модель Jev от TypeSafe создала категорию моделей решений. Ollaya отдаёт открытые модели через API, совместимый с TypeSafe: официальный Python SDK TypeSafe 0.7.1 работает без изменений с TYPESAFE_BASE_URL=http://localhost:11435 и любым API key. Ollaya не связана с TypeSafe. См. Совместимость с TypeSafe.
Какие модели я могу запускать?
Открытые модели решений из этих семейств. См. Models, где сравниваются их точность и скорость.
winnowот EldanRing: Winnow-E4B (winnow:e4b, рекомендуемая модель) и Winnow-12B (winnow), дообученные Gemma 4, опубликованные как GGUF-файлы. Ollaya запускает файл автора на llama.cpp, на GPU NVIDIA, GPU Apple silicon или CPU.winnow:e4bнабирает 0.722 на типизированных решениях, близко к 0.738 у Jev, примерно за 90 мс на RTX 4090.layaот Convai Innovations:laya(router),laya:en,laya:multilingualиlaya:typed-decisions, каждая также как-fp16и-fp32.layaотправляет английский текст вlaya:en, а другие языки, например турецкий, — вlaya:multilingual. Она самая быстрая.deciderот Mapika:decider:4b,decider:2bиdecider:0.8b, построенные на Qwen3.5.decider:4bнабирает 0.680 на типизированных решениях.decider:2b-visionтакже читает изображение вместе с состоянием.nliот Moritz Laurer: классификаторы NLI zero-shot на DeBERTa-v3-large и ModernBERT-large. Это самый точный энкодер.gliclassот Knowledgator: следующий инструкциям классификатор zero-shot, который оценивает каждый вариант за один проход.kevот Jared Palmer:kev:4b(kev),kev:0.8bиkev:9b, LoRA и указательная голова на Qwen3.5, которые оценивают каждый вариант на его собственном span, с калибровкой.kev:9bнабирает 0.722 на типизированных решениях, столько же, сколькоwinnow:e4b, но требует GPU на 24 ГБ и занимает около 500 мс.decisionот участников vLLM Semantic Router:decision:eos, Decision 1.0 Eos, полностью дообученная Qwen3.5-0.8B с головой-эндпоинтом, которая оценивает каждый вариант на его последнем токене, с калибровкой, со строками до 16 384 токенов.qwen3guardот команды Qwen: ограничитель безопасности на 119 языках. Он отвечает на свои встроенные вопросы (безопасно, спорно или небезопасно, а также категория небезопасного), поэтому вы отправляете ему только текст.vonот Victor Hugo Panisa: Von 1.1 на ModernBERT-large, который оценивает каждый вариант на его собственном маркере за один проход и читает состояния до 8 192 токенов.clmот Contrastive-LM: CLM-v0.1-8B, который встраивает состояние и каждый вариант с помощью Qwen3-8B и выбирает вариант, ближайший к состоянию, через две обученные головы. Вопросы и варианты кэшируются, поэтому повторяющиеся почти ничего не стоят. Она набирает 0.357 на типизированных решениях; авторы сделали её для состояний агентов, игр и вызова инструментов.jevk5от alibiserikbay: JevK5 v0.3, дообученная Qwen3.5-4B, опубликованная как GGUF-файлы. Ollaya запускает 4B Q8_0 файл автора на llama.cpp, с максимум 16 вариантами на вопрос.
Откуда берутся веса?
Из собственных репозиториев авторов моделей на Hugging Face, привязанных к коммиту. Каждый файл проверяется по его sha256 при загрузке. Ollaya никогда не перехостит веса: её реестр отдаёт только небольшие манифесты и производные файлы, например графы ONNX, которые ссылаются на веса по URL. Те же производные файлы опубликованы на Hugging Face под ollaya-dev.
Совпадают ли ответы с ответами исходной модели?
Ollaya запускает Laya как ONNX. На 2 383 вопросах на каждый чекпойнт (en, multilingual и typed-decisions) экспорт ONNX выбирал тот же ответ, что и эталон PyTorch fp32, в 100% случаев, при максимальной разнице вероятностей 1.1 × 10⁻⁴. На GPU CUDA по умолчанию работает граф fp16; он может отличаться от fp32 при близких результатах. Зафиксируйте тег -fp32, чтобы совпасть с эталоном.
Как модели соотносятся с Jev?
Зависит от модели. На типизированных решениях (2 000 вопросов) ближе всех winnow:e4b и kev:9b — 0.722 против 0.738 у Jev, — а winnow:e4b отвечает на пять вопросов примерно за 90 мс на RTX 4090, быстрее, чем хостинговый API Jev. Небольшие энкодеры, такие как laya, самые быстрые, но на сложных вопросах сильно уступают Jev. Домашняя страница перечисляет точность и скорость каждой модели. Об независимом сравнении открытых моделей решений с Jev по точности и калибровке см. Decision Index. Если у вас есть размеченные данные для фиксированной задачи, дообученная на них модель обычно превосходит любую общую.
Насколько это быстро?
Решение — это один прямой проход. Измерено сквозным образом через HTTP API на RTX 4090: медианный запрос с пятью вопросами занимает 8 мс с laya:multilingual и 10 мс с laya:en (fp16), 15 мс с gliclass, 20 мс с nli и 89 мс с winnow:e4b. Один вопрос занимает 8–11 мс на энкодерах. Более крупные декодеры занимают больше: kev:4b 354 мс, decider:4b 520 мс.
Нужна ли мне GPU?
Нет. Ollaya работает на CPU, а в x86-64 Linux и Windows использует GPU NVIDIA с драйвером R525 или новее, когда он есть (библиотеки CUDA 13 начиная с R580, до этого CUDA 12). Установочные скрипты скачивают библиотеки CUDA, только когда находят GPU. Десктопные приложения для Windows и Linux не включают библиотеки CUDA: сами по себе они запускают модели на CPU, а когда командная строка тоже установлена вместе с её GPU-библиотеками (и не старше приложения), приложение запускает сервер из той установки, который использует GPU. Модели GGUF, такие как winnow, работают на llama.cpp, который также использует GPU у Mac на Apple silicon (Metal); их паритет проверен на CUDA и на x86-64 CPU, но пока не на Metal. Это большие языковые модели, поэтому GPU даёт для них гораздо больше, чем для моделей-энкодеров: измеренные скорости смотрите на странице каждой модели. На картах серий RTX 30, 40 или 50 моделям GGUF больше ничего не нужно. На более старых картах или картах для дата-центров (серия GTX 10, V100, T4, A100, H100) библиотеки CUDA от llama.cpp несут код, который драйвер компилирует при первом использовании, а для этого нужен более новый драйвер: R570 или новее с библиотеками CUDA 12 и драйвер для CUDA 13.4 или новее с библиотеками CUDA 13. С более старым драйвером Ollaya запускает модели GGUF на CPU и пишет в журнал, почему; ollaya llama-devices показывает вычислительную способность каждого GPU и то, выполняются ли на нём ядра.
Какие платформы поддерживаются?
- Linux x86-64 и ARM64 с glibc 2.38 или новее: Ubuntu 24.04, Debian 13, Fedora 39, RHEL 10 или новее.
- macOS 14 или новее на Apple silicon.
layaиnli:modernbert-largeработают на GPU Apple через MLX, в 2–3 раза быстрее, чем на CPU; остальные модели работают на CPU. - Docker:
ghcr.io/ollaya-dev/ollayaдля linux/amd64 и linux/arm64, а:cudaдля GPU NVIDIA (:cuda12для драйверов хоста старше R580). Используйте его и на более старых дистрибутивах Linux. - Windows 10 и 11 на 64-битных ПК x86: десктопное приложение, а для командной строки
irm https://ollaya.dev/install.ps1 | iex, который тоже использует GPU NVIDIA (установите оба, и сервер приложения тоже будет его использовать). WSL 2 с установщиком для Linux тоже работает. - Десктопное приложение работает на всех трёх: см. Скачать.
Покидают ли мои данные мою машину?
Нет. Сервер по умолчанию слушает 127.0.0.1:11435 и запускает модели локально. Сеть используется только для загрузки моделей. Состояния и вопросы никогда не записываются в журнал.
Почему порт 11435?
Он стоит рядом со стандартным портом Ollama, 11434, так что обе могут работать бок о бок.
Как калибруются вероятности?
Масштабированием по температуре отдельно для каждого типа вопроса и числа вариантов, которое поставляется с каждой моделью. Для порогов, на которые вы полагаетесь, переподберите температуры на своих размеченных данных и запеките их через Modelfile.
Есть ли сервер MCP или навык для агентов?
И то и другое. ollaya mcp отдаёт локальные модели Claude Code, Claude Desktop, Cursor и другим клиентам MCP (claude mcp add ollaya -- ollaya mcp), а навык ollaya-decisions учит агентов, когда и как их использовать. См. Agents.
Как её обновить?
Запустите ollaya update. Он проверяет последний выпуск и, если есть более новый, снова запускает установочный скрипт в то же место, что сохраняет ваши модели и настройки службы. ollaya update --check только сообщает, есть ли обновление. Десктопное приложение обновляется целиком: установите новую версию из Скачать. В Docker загрузите новый образ.
Как её удалить?
В Linux, после того как установщик настроил службу:
sudo systemctl disable --now ollaya && sudo rm /etc/systemd/system/ollaya.service
sudo rm -rf /usr/local/bin/ollaya /usr/local/lib/ollaya /usr/local/share/doc/ollaya /usr/local/share/ollaya
sudo userdel -r ollaya # also deletes /usr/share/ollaya, including the models
Для установки без root (в ~/.local) удалите ~/.local/bin/ollaya, ~/.local/lib/ollaya, ~/.local/share/doc/ollaya и ~/.local/share/ollaya, а также модели в ~/.ollaya.
Какая лицензия?
Ollaya — Apache-2.0. У моделей свои лицензии: laya, decider, kev, decision, qwen3guard, gliclass, von, winnow, jevk5, clm и nli:modernbert-large — Apache-2.0, а nli:deberta-v3-large — MIT.