Introdução à IA
Por que a TypeSafe treina modelos de decisão com probabilidades calibradas em vez de otimizar para texto gerado.
A maioria dos produtos de IA gira em torno de uma conversa entre um modelo e uma pessoa. A TypeSafe parte de uma aposta diferente: a automação em larga escala será dominada por interações de IA com IA e de IA com software, então a interface de máquina importa mais do que a interface de chat.
Chamamos isso de Machine Native Intelligence:
IA com propriedades semelhantes às do software, como estrutura, confiabilidade, observabilidade, testabilidade, velocidade, consistência e baixo custo.
Construir produção, não um deus
A TypeSafe não está tentando construir um modelo que faz tudo. Ele é projetado para sistemas de produção em que o código precisa de uma decisão estreita que ele possa inspecionar e sobre a qual possa agir.
Nossa expectativa é que a automação de IA em larga escala se aproxime de 99% de interações máquina a máquina e 1% de interação humana. Isso desloca o alvo de design de respostas que soam bem à leitura para saídas que se comportam de forma previsível dentro do software.
Leia o manifesto da TypeSafe.
Três abordagens de pós-treinamento
Modelos de linguagem pré-treinados foram adaptados de duas maneiras principais. A TypeSafe acrescenta uma terceira. RLHF e RLVR aparecem aqui para dar contexto; o caminho de treinamento da TypeSafe é o RLCD.
RLHF
Reinforcement learning from human feedback transformou modelos pré-treinados em chatbots. Ele treina os modelos para produzir respostas que as pessoas preferem.
RLVR
Reinforcement learning with verifiable rewards criou modelos de raciocínio fortes em tarefas como matemática, mas mais lentos e mais caros.
RLCD
Reinforcement learning for calibrated decisions treina a TypeSafe para retornar decisões e probabilidades calibradas em vez de texto gerado.
O RLHF foi usado para treinar o InstructGPT e o ChatGPT e foi co-inventado por Diogo Almeida, cofundador da TypeSafe.


RLCD e decisões calibradas
O RLCD otimiza para um contrato de saída diferente:
- O modelo não gera texto.
- Ele retorna decisões e probabilidades.
- Uma probabilidade maior deve corresponder a uma chance maior de a resposta estar correta.
A calibração torna a incerteza utilizável pelo software. Em muitas previsões de um modelo bem calibrado:
- Resultados com probabilidade
0.2devem ocorrer cerca de 20% das vezes. - Resultados com probabilidade
0.8devem ocorrer cerca de 80% das vezes. - Resultados com probabilidade
1.0devem ocorrer 100% das vezes.
Essas taxas descrevem grupos de previsões, não uma garantia sobre qualquer resposta isolada. Veja Confiança para orientação sobre quando o software deve agir ou escalonar.
Os problemas do RLHF
O RLHF ensina um modelo a dizer coisas que as pessoas preferem. Esse objetivo funciona bem para chatbots, mas também pode recompensar a bajulação e alucinações que soam confiantes.
A otimização de preferência também causa mode dropping: o modelo aprende a favorecer um estilo específico, como seguir instruções, reduzindo a probabilidade de outras saídas possíveis.


Mode dropping é uma versão mais branda do mode collapse. No modo de falha clássico das redes adversárias generativas, um gerador aprende a produzir o mesmo tipo de saída repetidamente porque essa saída continua enganando o discriminador.
Analogia do mode collapse


O RLHF continua sendo uma boa opção para modelos conversacionais. A posição da TypeSafe é que a automação de produção precisa de um objetivo de treinamento diferente — centrado em decisões restritas e incerteza calibrada.