Documentação

Benchmarks e limites conhecidos

Os resultados do Laya dependem do checkpoint, da tarefa, do texto da pergunta, do número de opções e do hardware. Use as tabelas completas de benchmark para encontrar uma execução comparável antes de escolher um checkpoint ou um limiar de confiança. O diretório de pesquisa guarda os scripts e os arquivos de resultado por trás das tabelas principais.

Encontre a medição relevante

Se você precisa avaliar Comece por Verifique antes de aplicar o resultado
Decisões entre idiomas As tabelas MASSIVE e XNLI em BENCHMARKS.md Idioma, tarefa, número de opções e checkpoint
Um fluxo de trabalho como triagem ou moderação A tabela de fluxos de trabalho de aplicação em BENCHMARKS.md Se o conjunto de dados estava no mix de treino ou foi separado
O checkpoint laya-typed-decisions A tabela de typed-decisions em BENCHMARKS.md Ele foi ajustado na divisão de treino daquele benchmark; os checkpoints base têm linhas separadas
Tempo de resposta As seções T4, GB10, CPU de laptop e CPU de servidor em BENCHMARKS.md Dispositivo, tamanho de lote, número de perguntas, aquecimento e se o tempo HTTP está incluído

Os números publicados do Jev ao lado das suítes originais do Laya vêm de estudos de terceiros, com prompts e tamanhos de amostra diferentes. Eles são contexto útil, mas não são uma execução comparativa direta e controlada. Veja as notas de comparação em research/README.md.

Leia a precisão junto com a linha de base e a divisão dos dados. Por exemplo, o benchmark typed-decisions reporta 0.766 de precisão para o checkpoint ajustado, enquanto ambos os checkpoints base ficam abaixo da sua linha de base de classe majoritária de 0.461. Esse resultado sustenta o ajuste fino para uma tarefa semelhante; ele não estabelece 0.766 de precisão para um checkpoint não treinado nem para um domínio novo.

Leia a confiança separadamente da precisão. O erro de calibração esperado (ECE) mede quão bem as probabilidades reportadas correspondem à correção observada; menor é melhor. As colunas originais de ECE e confiança média da varredura de 51 idiomas são anteriores ao ajuste de temperatura do #42. Suas colunas de precisão ainda valem, mas use a reexecução com o ajuste aplicado em research/results/ ao comparar valores de confiança atuais. Nem um ECE menor em uma suíte define um limiar seguro para outra tarefa ou outro número de opções.

Limites a verificar nos seus próprios dados

  • Roteamento por idioma: O checkpoint em inglês pode ficar confiante em texto que ele trata mal fora do inglês. Use o Router para entradas de idiomas misturados e verifique as decisões de roteamento nos idiomas que você atende. O checkpoint multilíngue também pontua abaixo do checkpoint em inglês nas fatias MASSIVE e XNLI em inglês.
  • Muitas opções: As descrições de choice compartilham um orçamento fixo de tokens. A execução Banking77 de 77 rótulos tem desempenho ruim com o orçamento padrão. Mantenha uma pergunta choice com cerca de 20 opções, ou avalie uma pré-seleção e um orçamento de cabeça maior nos seus próprios rótulos.
  • Calibração: Ambos os checkpoints base são excessivamente confiantes nas suítes publicadas como distribuídos, mas uma tarefa separada de roteamento era pouco confiante. Ajuste e avalie temperaturas em exemplos separados e reservados do seu fluxo de trabalho antes de usar um gate de confiança.
  • Transferência de tarefa: A moderação em dados reservados é fraca no benchmark de aplicação, e o score ordinal é a primitiva mais fraca nas suítes em inglês reportadas. O checkpoint multilíngue também tem um viés medido contra o primeiro nível de score. Teste o tipo de pergunta e a distribuição de dados que você pretende atender.
  • Redação e ordem: A ordem das opções pode mudar uma resposta choice. Rótulos choice com palavras booleanas e pedidos negados também falharam em exemplos documentados; o noul pode seguir seus rótulos de opção em vez do estado. Verifique ordens alternativas das opções e a redação, especialmente quando uma decisão errada é custosa.
  • Documentos longos: O codificador multilíngue consegue ler até 8.192 tokens quando configurado para esse limite, mas o benchmark de contexto longo reporta respostas menos confiáveis além de cerca de 4.000 tokens de texto precedente. Meça a precisão nos comprimentos que você espera usar.
  • Latência: Os números da T4 não preveem o tempo de CPU nem o de carga a frio. Meça chamadas quentes e frias com seu próprio checkpoint, dispositivo, comprimentos de entrada e número de perguntas.

A seção Honest limits do README tem exemplos e contornos atuais. As tabelas de benchmark dão o conjunto de dados e o hardware por trás de cada um dos limites acima.

Reproduza ou amplie um resultado

Comece pelo mapa de scripts e resultados e pelo índice de execuções no topo de BENCHMARKS.md. research/scripts/bench_local.py roda a varredura de CPU de 51 idiomas, bench_apps.py cobre fluxos de trabalho de aplicação, e bench_latency.py mede a velocidade de roteamento e de inferência. O notebook da T4 é gerado a partir de research/scripts/build_benchmark_nb.py; edite o gerador ao mudar esse benchmark.

Para uma nova implantação, mantenha um conjunto reservado com os mesmos estados, perguntas e respostas esperadas para cada checkpoint que você comparar. Registre a revisão do checkpoint, as versões do Laya e das bibliotecas, o dispositivo, o número de perguntas, o número de opções e o orçamento de tokens a cada execução. Inclua uma linha de base simples de precisão e reporte a latência após o aquecimento, assim como o tempo de carga no primeiro uso. Isso torna seu resultado comparável às execuções publicadas e permite revisitá-lo após uma atualização.