Documentação

Introdução à IA

Porque é que a TypeSafe treina modelos de decisão com probabilidades calibradas em vez de otimizar para texto gerado.

A maioria dos produtos de IA é construída em torno de uma conversa entre um modelo e uma pessoa. A TypeSafe parte de uma aposta diferente: a automatização em grande escala será dominada por interações de IA com IA e de IA com software, por isso a interface máquina-máquina importa mais do que a interface de chat.

Chamamos a isto Machine Native Intelligence:

IA com propriedades semelhantes às do software, como estrutura, fiabilidade, observabilidade, testabilidade, velocidade, consistência e baixo custo.

Construir produção, não um deus

A TypeSafe não está a tentar construir um modelo que faça tudo. Foi concebida para sistemas de produção em que o código precisa de uma decisão estreita que possa inspecionar e sobre a qual possa agir.

A nossa expectativa é que a automatização de IA em grande escala se aproxime mais de 99% de interações máquina a máquina e 1% de interação humana. Isso desloca o objetivo de conceção das respostas que se leem bem para saídas que se comportam de forma previsível dentro do software.

Lê o manifesto da TypeSafe.

Três abordagens de pós-treino

Os modelos de linguagem pré-treinados foram adaptados de duas formas principais. A TypeSafe acrescenta uma terceira. RLHF e RLVR são mostrados aqui como contexto; o percurso de treino da TypeSafe é o RLCD.

RLHF

Reinforcement learning from human feedback transformou modelos pré-treinados em chatbots. Treina os modelos para produzirem respostas que as pessoas preferem.

RLVR

Reinforcement learning with verifiable rewards criou modelos de raciocínio que são fortes em tarefas como a matemática, mas mais lentos e mais caros.

RLCD

Reinforcement learning for calibrated decisions treina a TypeSafe para devolver decisões e probabilidades calibradas em vez de texto gerado.

O RLHF foi usado para treinar o InstructGPT e o ChatGPT e foi co-inventado por Diogo Almeida, cofundador da TypeSafe.

Modelos de linguagem pré-treinados que se ramificam em percursos RLHF e RLVR atenuados e num percurso de modelo de decisão RLCD realçado.

RLCD e decisões calibradas

O RLCD otimiza para um contrato de saída diferente:

  • O modelo não gera texto.
  • Devolve decisões e probabilidades.
  • Uma probabilidade mais alta deve corresponder a uma maior probabilidade de a resposta estar correta.

A calibração torna a incerteza utilizável pelo software. Ao longo de muitas previsões de um modelo bem calibrado:

  • Resultados com uma probabilidade atribuída de 0.2 devem ocorrer cerca de 20% das vezes.
  • Resultados com uma probabilidade atribuída de 0.8 devem ocorrer cerca de 80% das vezes.
  • Resultados com uma probabilidade atribuída de 1.0 devem ocorrer 100% das vezes.

Estas taxas descrevem grupos de previsões, não uma garantia sobre qualquer resposta individual. Vê Confiança para orientação sobre quando o software deve agir ou escalonar.

Os problemas do RLHF

O RLHF ensina um modelo a dizer coisas que as pessoas preferem. Esse objetivo funciona bem para chatbots, mas também pode recompensar a subserviência e alucinações que soam confiantes.

A otimização de preferências também provoca mode dropping: o modelo aprende a favorecer um estilo em particular, como seguir instruções, ao mesmo tempo que reduz a probabilidade de outras saídas possíveis.

A distribuição de probabilidade de um modelo base comparada com uma distribuição estreitada e com mode dropping após RLHF.

O mode dropping é uma versão mais ligeira do mode collapse. No modo de falha clássico das redes generativas adversárias, um gerador aprende a produzir o mesmo tipo de saída repetidamente porque essa saída continua a enganar o discriminador.

Analogia do mode collapse
Carateres repetidos que ilustram uma GAN a sofrer de mode collapse.

O RLHF continua a ser adequado para modelos conversacionais. A posição da TypeSafe é que a automatização de produção precisa de um objetivo de treino diferente — um centrado em decisões restritas e incerteza calibrada.