文档导航

AI 入门

AI 入门

为什么 TypeSafe 训练的是带校准概率的决策模型,而不是去优化生成的文本。

大多数 AI 产品都围绕「模型与人对话」来构建。TypeSafe 从一个不同的判断出发:大规模自动化将主要由 AI 对 AI、AI 对软件的交互构成,所以机器接口比聊天接口更重要。

我们把这叫做 Machine Native Intelligence:

具备软件式特性的 AI —— 结构化、可靠、可观测、可测试、快、一致,而且成本低。

构建生产系统,而不是造神

TypeSafe 并不想造一个什么都能做的模型。它面向的是生产系统 —— 在那里,代码只需要一个范围明确的决策,供它检查并据此行动。

我们的预期是:大规模 AI 自动化会接近 99% 的机器对机器交互、1% 的人机交互。这就把设计目标从「读起来舒服的回复」转向「在软件里行为可预测的输出」。

读一读 TypeSafe 宣言。

三种后训练路线

预训练语言模型主要有两种改造方式。TypeSafe 加了第三种。这里列出 RLHF 和 RLVR 是为了给个参照;TypeSafe 的训练路线是 RLCD。

RLHF

基于人类反馈的强化学习把预训练模型变成了聊天机器人。它训练模型产出人们更偏好的回复。

RLVR

带可验证奖励的强化学习造出了推理模型,这类模型擅长数学等任务,但更慢、更贵。

RLCD

面向校准决策的强化学习训练 TypeSafe 返回决策和校准过的概率,而不是生成的文本。

RLHF 曾被用来训练 InstructGPT 和 ChatGPT,它由 TypeSafe 联合创始人 Diogo Almeida 参与发明。

预训练语言模型分出被弱化的 RLHF 与 RLVR 两条路线,以及被着重强调的 RLCD 决策模型路线。

RLCD 与校准过的决策

RLCD 优化的是一份不同的输出契约:

  • 模型不生成文本。
  • 它返回决策和概率。
  • 概率越高,答案正确的可能性就应该越大。

校准让不确定性变得可供软件使用。对于一个校准良好的模型的大量预测:

  • 被赋予 0.2 概率的结果,大约应该有 20% 的时候发生。
  • 被赋予 0.8 概率的结果,大约应该有 80% 的时候发生。
  • 被赋予 1.0 概率的结果,应该 100% 发生。

这些比率描述的是成组的预测,并不保证任何单个答案。关于软件何时该行动、何时该升级,见置信度。

RLHF 的问题

RLHF 教模型说人们偏好的话。这个目标对聊天机器人很好用,但它也可能奖励谄媚,以及听起来很笃定的幻觉。

偏好优化还会导致模式丢失(mode dropping):模型学会偏好某种特定风格(比如遵循指令),同时降低其它可能输出的概率。

基础模型的概率分布,与经过 RLHF 后收窄、发生模式丢失的分布之对比。

模式丢失是模式崩溃(mode collapse)的温和版本。在经典的生成对抗网络失效模式里,生成器学会反复产出同一种输出,因为那种输出能持续骗过判别器。

模式崩溃的类比
重复的字符展示了一个陷入模式崩溃的 GAN。

RLHF 仍然很适合对话模型。TypeSafe 的立场是:生产自动化需要不同的训练目标 —— 一个以受限决策和校准过的不确定性为中心的目标。