Benchmarks e limites conhecidos
Os resultados do Laya dependem do checkpoint, da tarefa, do texto da pergunta, do número de opções e do hardware. Use as tabelas completas de benchmark para encontrar uma execução comparável antes de escolher um checkpoint ou um limiar de confiança. O diretório de pesquisa guarda os scripts e os arquivos de resultado por trás das tabelas principais.
Encontre a medição relevante
| Se você precisa avaliar | Comece por | Verifique antes de aplicar o resultado |
|---|---|---|
| Decisões entre idiomas | As tabelas MASSIVE e XNLI em BENCHMARKS.md |
Idioma, tarefa, número de opções e checkpoint |
| Um fluxo de trabalho como triagem ou moderação | A tabela de fluxos de trabalho de aplicação em BENCHMARKS.md |
Se o conjunto de dados estava no mix de treino ou foi separado |
O checkpoint laya-typed-decisions |
A tabela de typed-decisions em BENCHMARKS.md |
Ele foi ajustado na divisão de treino daquele benchmark; os checkpoints base têm linhas separadas |
| Tempo de resposta | As seções T4, GB10, CPU de laptop e CPU de servidor em BENCHMARKS.md |
Dispositivo, tamanho de lote, número de perguntas, aquecimento e se o tempo HTTP está incluído |
Os números publicados do Jev ao lado das suítes originais do Laya vêm de estudos de terceiros,
com prompts e tamanhos de amostra diferentes. Eles são contexto útil, mas não são uma execução
comparativa direta e controlada. Veja as notas de comparação em
research/README.md.
Leia a precisão junto com a linha de base e a divisão dos dados. Por exemplo, o benchmark typed-decisions reporta 0.766 de precisão para o checkpoint ajustado, enquanto ambos os checkpoints base ficam abaixo da sua linha de base de classe majoritária de 0.461. Esse resultado sustenta o ajuste fino para uma tarefa semelhante; ele não estabelece 0.766 de precisão para um checkpoint não treinado nem para um domínio novo.
Leia a confiança separadamente da precisão. O erro de calibração esperado (ECE) mede quão bem as
probabilidades reportadas correspondem à correção observada; menor é melhor. As colunas originais
de ECE e confiança média da varredura de 51 idiomas são anteriores ao ajuste de temperatura do #42.
Suas colunas de precisão ainda valem, mas use a reexecução com o ajuste aplicado em
research/results/ ao comparar valores de confiança atuais. Nem um ECE menor em uma suíte define um
limiar seguro para outra tarefa ou outro número de opções.
Limites a verificar nos seus próprios dados
- Roteamento por idioma: O checkpoint em inglês pode ficar confiante em texto que ele trata mal
fora do inglês. Use o
Routerpara entradas de idiomas misturados e verifique as decisões de roteamento nos idiomas que você atende. O checkpoint multilíngue também pontua abaixo do checkpoint em inglês nas fatias MASSIVE e XNLI em inglês. - Muitas opções: As descrições de choice compartilham um orçamento fixo de tokens. A execução Banking77 de 77 rótulos tem desempenho ruim com o orçamento padrão. Mantenha uma pergunta choice com cerca de 20 opções, ou avalie uma pré-seleção e um orçamento de cabeça maior nos seus próprios rótulos.
- Calibração: Ambos os checkpoints base são excessivamente confiantes nas suítes publicadas como distribuídos, mas uma tarefa separada de roteamento era pouco confiante. Ajuste e avalie temperaturas em exemplos separados e reservados do seu fluxo de trabalho antes de usar um gate de confiança.
- Transferência de tarefa: A moderação em dados reservados é fraca no benchmark de aplicação, e
o
scoreordinal é a primitiva mais fraca nas suítes em inglês reportadas. O checkpoint multilíngue também tem um viés medido contra o primeiro nível descore. Teste o tipo de pergunta e a distribuição de dados que você pretende atender. - Redação e ordem: A ordem das opções pode mudar uma resposta
choice. Rótulos choice com palavras booleanas e pedidos negados também falharam em exemplos documentados; onoulpode seguir seus rótulos de opção em vez do estado. Verifique ordens alternativas das opções e a redação, especialmente quando uma decisão errada é custosa. - Documentos longos: O codificador multilíngue consegue ler até 8.192 tokens quando configurado para esse limite, mas o benchmark de contexto longo reporta respostas menos confiáveis além de cerca de 4.000 tokens de texto precedente. Meça a precisão nos comprimentos que você espera usar.
- Latência: Os números da T4 não preveem o tempo de CPU nem o de carga a frio. Meça chamadas quentes e frias com seu próprio checkpoint, dispositivo, comprimentos de entrada e número de perguntas.
A seção Honest limits do README tem exemplos e contornos atuais. As tabelas de benchmark dão o conjunto de dados e o hardware por trás de cada um dos limites acima.
Reproduza ou amplie um resultado
Comece pelo mapa de scripts e resultados
e pelo índice de execuções no topo de BENCHMARKS.md. research/scripts/bench_local.py roda a
varredura de CPU de 51 idiomas, bench_apps.py cobre fluxos de trabalho de aplicação, e
bench_latency.py mede a velocidade de roteamento e de inferência. O notebook da T4 é gerado a
partir de research/scripts/build_benchmark_nb.py; edite o gerador ao mudar esse benchmark.
Para uma nova implantação, mantenha um conjunto reservado com os mesmos estados, perguntas e respostas esperadas para cada checkpoint que você comparar. Registre a revisão do checkpoint, as versões do Laya e das bibliotecas, o dispositivo, o número de perguntas, o número de opções e o orçamento de tokens a cada execução. Inclua uma linha de base simples de precisão e reporte a latência após o aquecimento, assim como o tempo de carga no primeiro uso. Isso torna seu resultado comparável às execuções publicadas e permite revisitá-lo após uma atualização.