Introdução à IA
Porque é que a TypeSafe treina modelos de decisão com probabilidades calibradas em vez de otimizar para texto gerado.
A maioria dos produtos de IA é construída em torno de uma conversa entre um modelo e uma pessoa. A TypeSafe parte de uma aposta diferente: a automatização em grande escala será dominada por interações de IA com IA e de IA com software, por isso a interface máquina-máquina importa mais do que a interface de chat.
Chamamos a isto Machine Native Intelligence:
IA com propriedades semelhantes às do software, como estrutura, fiabilidade, observabilidade, testabilidade, velocidade, consistência e baixo custo.
Construir produção, não um deus
A TypeSafe não está a tentar construir um modelo que faça tudo. Foi concebida para sistemas de produção em que o código precisa de uma decisão estreita que possa inspecionar e sobre a qual possa agir.
A nossa expectativa é que a automatização de IA em grande escala se aproxime mais de 99% de interações máquina a máquina e 1% de interação humana. Isso desloca o objetivo de conceção das respostas que se leem bem para saídas que se comportam de forma previsível dentro do software.
Lê o manifesto da TypeSafe.
Três abordagens de pós-treino
Os modelos de linguagem pré-treinados foram adaptados de duas formas principais. A TypeSafe acrescenta uma terceira. RLHF e RLVR são mostrados aqui como contexto; o percurso de treino da TypeSafe é o RLCD.
RLHF
Reinforcement learning from human feedback transformou modelos pré-treinados em chatbots. Treina os modelos para produzirem respostas que as pessoas preferem.
RLVR
Reinforcement learning with verifiable rewards criou modelos de raciocínio que são fortes em tarefas como a matemática, mas mais lentos e mais caros.
RLCD
Reinforcement learning for calibrated decisions treina a TypeSafe para devolver decisões e probabilidades calibradas em vez de texto gerado.
O RLHF foi usado para treinar o InstructGPT e o ChatGPT e foi co-inventado por Diogo Almeida, cofundador da TypeSafe.


RLCD e decisões calibradas
O RLCD otimiza para um contrato de saída diferente:
- O modelo não gera texto.
- Devolve decisões e probabilidades.
- Uma probabilidade mais alta deve corresponder a uma maior probabilidade de a resposta estar correta.
A calibração torna a incerteza utilizável pelo software. Ao longo de muitas previsões de um modelo bem calibrado:
- Resultados com uma probabilidade atribuída de
0.2devem ocorrer cerca de 20% das vezes. - Resultados com uma probabilidade atribuída de
0.8devem ocorrer cerca de 80% das vezes. - Resultados com uma probabilidade atribuída de
1.0devem ocorrer 100% das vezes.
Estas taxas descrevem grupos de previsões, não uma garantia sobre qualquer resposta individual. Vê Confiança para orientação sobre quando o software deve agir ou escalonar.
Os problemas do RLHF
O RLHF ensina um modelo a dizer coisas que as pessoas preferem. Esse objetivo funciona bem para chatbots, mas também pode recompensar a subserviência e alucinações que soam confiantes.
A otimização de preferências também provoca mode dropping: o modelo aprende a favorecer um estilo em particular, como seguir instruções, ao mesmo tempo que reduz a probabilidade de outras saídas possíveis.


O mode dropping é uma versão mais ligeira do mode collapse. No modo de falha clássico das redes generativas adversárias, um gerador aprende a produzir o mesmo tipo de saída repetidamente porque essa saída continua a enganar o discriminador.
Analogia do mode collapse


O RLHF continua a ser adequado para modelos conversacionais. A posição da TypeSafe é que a automatização de produção precisa de um objetivo de treino diferente — um centrado em decisões restritas e incerteza calibrada.