Документация

Бенчмарки и известные ограничения

Результаты Laya зависят от чекпойнта, задачи, формулировки вопроса, числа вариантов и оборудования. Используйте полные таблицы бенчмарков, чтобы найти сопоставимый запуск, прежде чем выбирать чекпойнт или порог уверенности. Каталог research содержит скрипты и файлы результатов, стоящие за основными таблицами.

Найдите нужное измерение

Если вам нужно оценить Начните с Проверьте перед применением результата
Решения на разных языках Таблицы MASSIVE и XNLI в BENCHMARKS.md Язык, задача, число вариантов и чекпойнт
Рабочий процесс вроде триажа или модерации Таблица прикладных рабочих процессов в BENCHMARKS.md Был ли набор данных в обучающей смеси или отложен
Чекпойнт laya-typed-decisions Таблица typed-decisions в BENCHMARKS.md Он дообучался на обучающей части этого бенчмарка; у базовых чекпойнтов отдельные строки
Время отклика Разделы T4, GB10, CPU ноутбука и CPU сервера в BENCHMARKS.md Устройство, размер батча, число вопросов, прогрев и включается ли время HTTP

Опубликованные показатели Jev рядом с оригинальными наборами Laya взяты из сторонних исследований с другими промптами и размерами выборки. Они полезны как контекст, но не являются контролируемым очным сравнением. Смотрите заметки о сравнении в research/README.md.

Читайте точность вместе с базовой линией и разбиением данных. Например, бенчмарк typed-decisions сообщает точность 0.766 для дообученного чекпойнта, тогда как оба базовых чекпойнта набирают меньше его базовой линии мажоритарного класса 0.461. Этот результат поддерживает дообучение для похожей задачи; он не устанавливает точность 0.766 для необученного чекпойнта или нового домена.

Читайте уверенность отдельно от точности. Ожидаемая ошибка калибровки (ECE) измеряет, насколько хорошо сообщённые вероятности совпадают с наблюдаемой правильностью; меньше — лучше. Исходные столбцы ECE и средней уверенности развёртки по 51 языку относятся ко времени до температурного ограничения в #42. Её столбцы точности по-прежнему применимы, но используйте повторный прогон с ограничением в research/results/ при сравнении текущих значений уверенности. Даже более низкая ECE на одном наборе не задаёт безопасный порог для другой задачи или другого числа вариантов.

Ограничения, которые следует проверить на своих данных

  • Маршрутизация по языку: Английский чекпойнт может быть уверен на тексте, который он плохо обрабатывает вне английского. Используйте Router для смешанных по языку входов и проверяйте решения маршрутизации на тех языках, которые вы обслуживаете. Многоязычный чекпойнт также набирает меньше английского чекпойнта на английских срезах MASSIVE и XNLI.
  • Много вариантов: Описания choice делят фиксированный бюджет токенов. Прогон Banking77 с 77 метками показывает плохие результаты при бюджете по умолчанию. Держите единственный вопрос choice примерно в пределах 20 вариантов или оцените шортлист и больший бюджет головы на своих метках.
  • Калибровка: Оба базовых чекпойнта в том виде, как они поставляются, слишком уверены на опубликованных наборах, а отдельная задача маршрутизации была недостаточно уверенной. Настройте и оцените температуры на отдельных отложенных примерах из вашего рабочего процесса, прежде чем использовать порог уверенности.
  • Перенос задачи: Отложенная модерация слаба в прикладном бенчмарке, а порядковый score — самый слабый примитив в сообщённых английских наборах. У многоязычного чекпойнта также есть измеренное смещение против первого уровня score. Проверяйте фактический тип вопроса и распределение данных, которые вы собираетесь обслуживать.
  • Формулировка и порядок: Порядок вариантов может изменить ответ choice. Варианты choice, состоящие из булевых слов, и отрицаемые запросы тоже проваливались в задокументированных примерах; noul может следовать своим меткам вариантов вместо состояния. Проверяйте альтернативные порядки вариантов и формулировки, особенно когда неверное решение дорого стоит.
  • Длинные документы: Многоязычный энкодер может читать до 8,192 токенов, когда настроен на этот предел, но бенчмарк длинного контекста сообщает о менее надёжных ответах свыше примерно 4,000 токенов предшествующего текста. Измеряйте точность на тех длинах, которые ожидаете в работе.
  • Задержка: Показатели T4 не предсказывают время CPU или холодной загрузки. Измеряйте тёплые и холодные вызовы с вашим собственным чекпойнтом, устройством, длинами входа и числом вопросов.

В разделе Honest limits в README есть примеры и текущие обходные решения. Таблицы бенчмарков дают набор данных и оборудование, стоящие за каждым из ограничений выше.

Воспроизвести или расширить результат

Начните с карты скриптов и результатов и индекса запусков в начале BENCHMARKS.md. research/scripts/bench_local.py выполняет развёртку по 51 языку на CPU, bench_apps.py охватывает прикладные рабочие процессы, а bench_latency.py измеряет скорость маршрутизации и инференса. Ноутбук T4 генерируется из research/scripts/build_benchmark_nb.py; правьте генератор, когда меняете этот бенчмарк.

Для нового развёртывания держите отложенный набор с теми же состояниями, вопросами и ожидаемыми ответами для каждого сравниваемого чекпойнта. Записывайте ревизию чекпойнта, версии Laya и библиотек, устройство, число вопросов, число вариантов и бюджет токенов для каждого запуска. Включите простую базовую линию для точности и сообщайте задержку после прогрева, а также время загрузки при первом использовании. Это делает ваш результат сопоставимым с опубликованными запусками и позволяет вернуться к нему после обновления.