Documentação

Introdução à IA

Por que a TypeSafe treina modelos de decisão com probabilidades calibradas em vez de otimizar para texto gerado.

A maioria dos produtos de IA gira em torno de uma conversa entre um modelo e uma pessoa. A TypeSafe parte de uma aposta diferente: a automação em larga escala será dominada por interações de IA com IA e de IA com software, então a interface de máquina importa mais do que a interface de chat.

Chamamos isso de Machine Native Intelligence:

IA com propriedades semelhantes às do software, como estrutura, confiabilidade, observabilidade, testabilidade, velocidade, consistência e baixo custo.

Construir produção, não um deus

A TypeSafe não está tentando construir um modelo que faz tudo. Ele é projetado para sistemas de produção em que o código precisa de uma decisão estreita que ele possa inspecionar e sobre a qual possa agir.

Nossa expectativa é que a automação de IA em larga escala se aproxime de 99% de interações máquina a máquina e 1% de interação humana. Isso desloca o alvo de design de respostas que soam bem à leitura para saídas que se comportam de forma previsível dentro do software.

Leia o manifesto da TypeSafe.

Três abordagens de pós-treinamento

Modelos de linguagem pré-treinados foram adaptados de duas maneiras principais. A TypeSafe acrescenta uma terceira. RLHF e RLVR aparecem aqui para dar contexto; o caminho de treinamento da TypeSafe é o RLCD.

RLHF

Reinforcement learning from human feedback transformou modelos pré-treinados em chatbots. Ele treina os modelos para produzir respostas que as pessoas preferem.

RLVR

Reinforcement learning with verifiable rewards criou modelos de raciocínio fortes em tarefas como matemática, mas mais lentos e mais caros.

RLCD

Reinforcement learning for calibrated decisions treina a TypeSafe para retornar decisões e probabilidades calibradas em vez de texto gerado.

O RLHF foi usado para treinar o InstructGPT e o ChatGPT e foi co-inventado por Diogo Almeida, cofundador da TypeSafe.

Modelos de linguagem pré-treinados se ramificam em caminhos RLHF e RLVR atenuados e um caminho RLCD de modelo de decisão em destaque.

RLCD e decisões calibradas

O RLCD otimiza para um contrato de saída diferente:

  • O modelo não gera texto.
  • Ele retorna decisões e probabilidades.
  • Uma probabilidade maior deve corresponder a uma chance maior de a resposta estar correta.

A calibração torna a incerteza utilizável pelo software. Em muitas previsões de um modelo bem calibrado:

  • Resultados com probabilidade 0.2 devem ocorrer cerca de 20% das vezes.
  • Resultados com probabilidade 0.8 devem ocorrer cerca de 80% das vezes.
  • Resultados com probabilidade 1.0 devem ocorrer 100% das vezes.

Essas taxas descrevem grupos de previsões, não uma garantia sobre qualquer resposta isolada. Veja Confiança para orientação sobre quando o software deve agir ou escalonar.

Os problemas do RLHF

O RLHF ensina um modelo a dizer coisas que as pessoas preferem. Esse objetivo funciona bem para chatbots, mas também pode recompensar a bajulação e alucinações que soam confiantes.

A otimização de preferência também causa mode dropping: o modelo aprende a favorecer um estilo específico, como seguir instruções, reduzindo a probabilidade de outras saídas possíveis.

A distribuição de probabilidade de um modelo base comparada com uma distribuição estreitada por mode dropping após o RLHF.

Mode dropping é uma versão mais branda do mode collapse. No modo de falha clássico das redes adversárias generativas, um gerador aprende a produzir o mesmo tipo de saída repetidamente porque essa saída continua enganando o discriminador.

Analogia do mode collapse
Caracteres repetidos ilustram uma GAN sofrendo de mode collapse.

O RLHF continua sendo uma boa opção para modelos conversacionais. A posição da TypeSafe é que a automação de produção precisa de um objetivo de treinamento diferente — centrado em decisões restritas e incerteza calibrada.