AI 入门
AI 入门
为什么 TypeSafe 训练的是带校准概率的决策模型,而不是去优化生成的文本。
大多数 AI 产品都围绕「模型与人对话」来构建。TypeSafe 从一个不同的判断出发:大规模自动化将主要由 AI 对 AI、AI 对软件的交互构成,所以机器接口比聊天接口更重要。
我们把这叫做 Machine Native Intelligence:
具备软件式特性的 AI —— 结构化、可靠、可观测、可测试、快、一致,而且成本低。
构建生产系统,而不是造神
TypeSafe 并不想造一个什么都能做的模型。它面向的是生产系统 —— 在那里,代码只需要一个范围明确的决策,供它检查并据此行动。
我们的预期是:大规模 AI 自动化会接近 99% 的机器对机器交互、1% 的人机交互。这就把设计目标从「读起来舒服的回复」转向「在软件里行为可预测的输出」。
读一读 TypeSafe 宣言。
三种后训练路线
预训练语言模型主要有两种改造方式。TypeSafe 加了第三种。这里列出 RLHF 和 RLVR 是为了给个参照;TypeSafe 的训练路线是 RLCD。
RLHF
基于人类反馈的强化学习把预训练模型变成了聊天机器人。它训练模型产出人们更偏好的回复。
RLVR
带可验证奖励的强化学习造出了推理模型,这类模型擅长数学等任务,但更慢、更贵。
RLCD
面向校准决策的强化学习训练 TypeSafe 返回决策和校准过的概率,而不是生成的文本。
RLHF 曾被用来训练 InstructGPT 和 ChatGPT,它由 TypeSafe 联合创始人 Diogo Almeida 参与发明。


RLCD 与校准过的决策
RLCD 优化的是一份不同的输出契约:
- 模型不生成文本。
- 它返回决策和概率。
- 概率越高,答案正确的可能性就应该越大。
校准让不确定性变得可供软件使用。对于一个校准良好的模型的大量预测:
- 被赋予
0.2概率的结果,大约应该有 20% 的时候发生。 - 被赋予
0.8概率的结果,大约应该有 80% 的时候发生。 - 被赋予
1.0概率的结果,应该 100% 发生。
这些比率描述的是成组的预测,并不保证任何单个答案。关于软件何时该行动、何时该升级,见置信度。
RLHF 的问题
RLHF 教模型说人们偏好的话。这个目标对聊天机器人很好用,但它也可能奖励谄媚,以及听起来很笃定的幻觉。
偏好优化还会导致模式丢失(mode dropping):模型学会偏好某种特定风格(比如遵循指令),同时降低其它可能输出的概率。


模式丢失是模式崩溃(mode collapse)的温和版本。在经典的生成对抗网络失效模式里,生成器学会反复产出同一种输出,因为那种输出能持续骗过判别器。
模式崩溃的类比


RLHF 仍然很适合对话模型。TypeSafe 的立场是:生产自动化需要不同的训练目标 —— 一个以受限决策和校准过的不确定性为中心的目标。