Введение в ИИ
Почему TypeSafe обучает модели решений с калиброванными вероятностями, а не оптимизирует сгенерированный текст.
Большинство ИИ-продуктов построены вокруг беседы между моделью и человеком. TypeSafe исходит из другой ставки: в крупномасштабной автоматизации будут преобладать взаимодействия «ИИ–ИИ» и «ИИ–софт», поэтому машинный интерфейс важнее чат-интерфейса.
Мы называем это Machine Native Intelligence:
ИИ со свойствами, присущими софту: структура, надёжность, наблюдаемость, тестируемость, скорость, согласованность и низкая стоимость.
Строим продакшен, а не божество
TypeSafe не пытается построить модель, которая умеет всё. Она создана для продакшен-систем, где коду нужно узкое решение, которое он может проверить и по которому может действовать.
Мы ожидаем, что крупномасштабная ИИ-автоматизация будет ближе к 99% взаимодействий «машина–машина» и 1% взаимодействий с человеком. Это смещает цель проектирования с ответов, которые приятно читать, к выводам, которые предсказуемо ведут себя внутри софта.
Прочитайте манифест TypeSafe.
Три подхода к постобучению
Предобученные языковые модели адаптировали двумя основными способами. TypeSafe добавляет третий. RLHF и RLVR показаны здесь для контекста; путь обучения TypeSafe — RLCD.
RLHF
Обучение с подкреплением на основе обратной связи от людей превратило предобученные модели в чат-ботов. Оно учит модели выдавать ответы, которые предпочитают люди.
RLVR
Обучение с подкреплением с проверяемыми наградами создало модели рассуждений, сильные в таких задачах, как математика, но более медленные и дорогие.
RLCD
Обучение с подкреплением для калиброванных решений учит TypeSafe возвращать решения и калиброванные вероятности вместо сгенерированного текста.
RLHF применялось для обучения InstructGPT и ChatGPT; его соавтор — Diogo Almeida, соучредитель TypeSafe.


RLCD и калиброванные решения
RLCD оптимизирует другой контракт вывода:
- Модель не генерирует текст.
- Она возвращает решения и вероятности.
- Чем выше вероятность, тем больше шанс, что ответ правильный.
Калибровка делает неопределённость пригодной для использования в софте. На множестве предсказаний хорошо калиброванной модели:
- Исходы с вероятностью
0.2должны происходить примерно в 20% случаев. - Исходы с вероятностью
0.8— примерно в 80% случаев. - Исходы с вероятностью
1.0— в 100% случаев.
Эти доли описывают группы предсказаний, а не гарантию для любого отдельного ответа. См. Уверенность с рекомендациями, когда софту следует действовать или эскалировать.
Проблемы RLHF
RLHF учит модель говорить то, что предпочитают люди. Эта цель хорошо работает для чат-ботов, но она также может поощрять подхалимство и уверенно звучащие галлюцинации.
Оптимизация предпочтений также вызывает отсев мод (mode dropping): модель учится отдавать предпочтение определённому стилю, например следованию инструкциям, снижая вероятность других возможных выводов.


Отсев мод — более мягкая версия коллапса мод. В классическом режиме отказа генеративно-состязательной сети генератор учится раз за разом выдавать один и тот же тип вывода, потому что такой вывод продолжает обманывать дискриминатор.
Аналогия коллапса мод


RLHF по-прежнему хорошо подходит для разговорных моделей. Позиция TypeSafe в том, что продакшен-автоматизации нужна другая цель обучения — сосредоточенная на ограниченных решениях и калиброванной неопределённости.