Бенчмарки и известные ограничения
Результаты Laya зависят от чекпойнта, задачи, формулировки вопроса, числа вариантов и оборудования. Используйте полные таблицы бенчмарков, чтобы найти сопоставимый запуск, прежде чем выбирать чекпойнт или порог уверенности. Каталог research содержит скрипты и файлы результатов, стоящие за основными таблицами.
Найдите нужное измерение
| Если вам нужно оценить | Начните с | Проверьте перед применением результата |
|---|---|---|
| Решения на разных языках | Таблицы MASSIVE и XNLI в BENCHMARKS.md |
Язык, задача, число вариантов и чекпойнт |
| Рабочий процесс вроде триажа или модерации | Таблица прикладных рабочих процессов в BENCHMARKS.md |
Был ли набор данных в обучающей смеси или отложен |
Чекпойнт laya-typed-decisions |
Таблица typed-decisions в BENCHMARKS.md |
Он дообучался на обучающей части этого бенчмарка; у базовых чекпойнтов отдельные строки |
| Время отклика | Разделы T4, GB10, CPU ноутбука и CPU сервера в BENCHMARKS.md |
Устройство, размер батча, число вопросов, прогрев и включается ли время HTTP |
Опубликованные показатели Jev рядом с оригинальными наборами Laya взяты из сторонних исследований
с другими промптами и размерами выборки. Они полезны как контекст, но не являются контролируемым
очным сравнением. Смотрите заметки о сравнении в
research/README.md.
Читайте точность вместе с базовой линией и разбиением данных. Например, бенчмарк typed-decisions сообщает точность 0.766 для дообученного чекпойнта, тогда как оба базовых чекпойнта набирают меньше его базовой линии мажоритарного класса 0.461. Этот результат поддерживает дообучение для похожей задачи; он не устанавливает точность 0.766 для необученного чекпойнта или нового домена.
Читайте уверенность отдельно от точности. Ожидаемая ошибка калибровки (ECE) измеряет, насколько
хорошо сообщённые вероятности совпадают с наблюдаемой правильностью; меньше — лучше. Исходные
столбцы ECE и средней уверенности развёртки по 51 языку относятся ко времени до температурного
ограничения в #42. Её столбцы точности по-прежнему применимы, но используйте повторный прогон с
ограничением в research/results/ при сравнении текущих значений уверенности. Даже более низкая ECE
на одном наборе не задаёт безопасный порог для другой задачи или другого числа вариантов.
Ограничения, которые следует проверить на своих данных
- Маршрутизация по языку: Английский чекпойнт может быть уверен на тексте, который он плохо
обрабатывает вне английского. Используйте
Routerдля смешанных по языку входов и проверяйте решения маршрутизации на тех языках, которые вы обслуживаете. Многоязычный чекпойнт также набирает меньше английского чекпойнта на английских срезах MASSIVE и XNLI. - Много вариантов: Описания choice делят фиксированный бюджет токенов. Прогон Banking77 с 77 метками показывает плохие результаты при бюджете по умолчанию. Держите единственный вопрос choice примерно в пределах 20 вариантов или оцените шортлист и больший бюджет головы на своих метках.
- Калибровка: Оба базовых чекпойнта в том виде, как они поставляются, слишком уверены на опубликованных наборах, а отдельная задача маршрутизации была недостаточно уверенной. Настройте и оцените температуры на отдельных отложенных примерах из вашего рабочего процесса, прежде чем использовать порог уверенности.
- Перенос задачи: Отложенная модерация слаба в прикладном бенчмарке, а порядковый
score— самый слабый примитив в сообщённых английских наборах. У многоязычного чекпойнта также есть измеренное смещение против первого уровняscore. Проверяйте фактический тип вопроса и распределение данных, которые вы собираетесь обслуживать. - Формулировка и порядок: Порядок вариантов может изменить ответ
choice. Варианты choice, состоящие из булевых слов, и отрицаемые запросы тоже проваливались в задокументированных примерах;noulможет следовать своим меткам вариантов вместо состояния. Проверяйте альтернативные порядки вариантов и формулировки, особенно когда неверное решение дорого стоит. - Длинные документы: Многоязычный энкодер может читать до 8,192 токенов, когда настроен на этот предел, но бенчмарк длинного контекста сообщает о менее надёжных ответах свыше примерно 4,000 токенов предшествующего текста. Измеряйте точность на тех длинах, которые ожидаете в работе.
- Задержка: Показатели T4 не предсказывают время CPU или холодной загрузки. Измеряйте тёплые и холодные вызовы с вашим собственным чекпойнтом, устройством, длинами входа и числом вопросов.
В разделе Honest limits в README есть примеры и текущие обходные решения. Таблицы бенчмарков дают набор данных и оборудование, стоящие за каждым из ограничений выше.
Воспроизвести или расширить результат
Начните с карты скриптов и результатов
и индекса запусков в начале BENCHMARKS.md. research/scripts/bench_local.py выполняет развёртку по
51 языку на CPU, bench_apps.py охватывает прикладные рабочие процессы, а bench_latency.py измеряет
скорость маршрутизации и инференса. Ноутбук T4 генерируется из
research/scripts/build_benchmark_nb.py; правьте генератор, когда меняете этот бенчмарк.
Для нового развёртывания держите отложенный набор с теми же состояниями, вопросами и ожидаемыми ответами для каждого сравниваемого чекпойнта. Записывайте ревизию чекпойнта, версии Laya и библиотек, устройство, число вопросов, число вариантов и бюджет токенов для каждого запуска. Включите простую базовую линию для точности и сообщайте задержку после прогрева, а также время загрузки при первом использовании. Это делает ваш результат сопоставимым с опубликованными запусками и позволяет вернуться к нему после обновления.