Документация

Введение в ИИ

Почему TypeSafe обучает модели решений с калиброванными вероятностями, а не оптимизирует сгенерированный текст.

Большинство ИИ-продуктов построены вокруг беседы между моделью и человеком. TypeSafe исходит из другой ставки: в крупномасштабной автоматизации будут преобладать взаимодействия «ИИ–ИИ» и «ИИ–софт», поэтому машинный интерфейс важнее чат-интерфейса.

Мы называем это Machine Native Intelligence:

ИИ со свойствами, присущими софту: структура, надёжность, наблюдаемость, тестируемость, скорость, согласованность и низкая стоимость.

Строим продакшен, а не божество

TypeSafe не пытается построить модель, которая умеет всё. Она создана для продакшен-систем, где коду нужно узкое решение, которое он может проверить и по которому может действовать.

Мы ожидаем, что крупномасштабная ИИ-автоматизация будет ближе к 99% взаимодействий «машина–машина» и 1% взаимодействий с человеком. Это смещает цель проектирования с ответов, которые приятно читать, к выводам, которые предсказуемо ведут себя внутри софта.

Прочитайте манифест TypeSafe.

Три подхода к постобучению

Предобученные языковые модели адаптировали двумя основными способами. TypeSafe добавляет третий. RLHF и RLVR показаны здесь для контекста; путь обучения TypeSafe — RLCD.

RLHF

Обучение с подкреплением на основе обратной связи от людей превратило предобученные модели в чат-ботов. Оно учит модели выдавать ответы, которые предпочитают люди.

RLVR

Обучение с подкреплением с проверяемыми наградами создало модели рассуждений, сильные в таких задачах, как математика, но более медленные и дорогие.

RLCD

Обучение с подкреплением для калиброванных решений учит TypeSafe возвращать решения и калиброванные вероятности вместо сгенерированного текста.

RLHF применялось для обучения InstructGPT и ChatGPT; его соавтор — Diogo Almeida, соучредитель TypeSafe.

Предобученные языковые модели ветвятся на приглушённые пути RLHF и RLVR и выделенный путь RLCD-модели решений.

RLCD и калиброванные решения

RLCD оптимизирует другой контракт вывода:

  • Модель не генерирует текст.
  • Она возвращает решения и вероятности.
  • Чем выше вероятность, тем больше шанс, что ответ правильный.

Калибровка делает неопределённость пригодной для использования в софте. На множестве предсказаний хорошо калиброванной модели:

  • Исходы с вероятностью 0.2 должны происходить примерно в 20% случаев.
  • Исходы с вероятностью 0.8 — примерно в 80% случаев.
  • Исходы с вероятностью 1.0 — в 100% случаев.

Эти доли описывают группы предсказаний, а не гарантию для любого отдельного ответа. См. Уверенность с рекомендациями, когда софту следует действовать или эскалировать.

Проблемы RLHF

RLHF учит модель говорить то, что предпочитают люди. Эта цель хорошо работает для чат-ботов, но она также может поощрять подхалимство и уверенно звучащие галлюцинации.

Оптимизация предпочтений также вызывает отсев мод (mode dropping): модель учится отдавать предпочтение определённому стилю, например следованию инструкциям, снижая вероятность других возможных выводов.

Распределение вероятностей базовой модели в сравнении с суженным распределением с отсевом мод после RLHF.

Отсев мод — более мягкая версия коллапса мод. В классическом режиме отказа генеративно-состязательной сети генератор учится раз за разом выдавать один и тот же тип вывода, потому что такой вывод продолжает обманывать дискриминатор.

Аналогия коллапса мод
Повторяющиеся символы иллюстрируют GAN, страдающую от коллапса мод.

RLHF по-прежнему хорошо подходит для разговорных моделей. Позиция TypeSafe в том, что продакшен-автоматизации нужна другая цель обучения — сосредоточенная на ограниченных решениях и калиброванной неопределённости.