文件導航

AI 入門

為什麼 TypeSafe 訓練的是帶校準機率的決策模型,而不是去最佳化生成的文本。

大多數 AI 產品都圍繞「模型與人對話」來構建。TypeSafe 從一個不同的判斷出發:大規模自動化將主要由 AI 對 AI、AI 對軟體的互動構成,所以機器介面比聊天介面更重要。

我們把這叫做 Machine Native Intelligence:

具備軟體式特性的 AI —— 結構化、可靠、可觀測、可測試、快、一致,而且成本低。

構建生產系統,而不是造神

TypeSafe 並不想造一個什麼都能做的模型。它面向的是生產系統 —— 在那裡,程式碼只需要一個範圍明確的決策,供它檢查並據此行動。

我們的預期是:大規模 AI 自動化會接近 99% 的機器對機器互動、1% 的人機互動。這就把設計目標從「讀起來舒服的回覆」轉向「在軟體裡行為可預測的輸出」。

讀一讀 TypeSafe 宣言。

三種後訓練路線

預訓練語言模型主要有兩種改造方式。TypeSafe 加了第三種。這裡列出 RLHF 和 RLVR 是為了給個參照;TypeSafe 的訓練路線是 RLCD。

RLHF

基於人類反饋的強化學習把預訓練模型變成了聊天機器人。它訓練模型產出人們更偏好的回覆。

RLVR

帶可驗證獎勵的強化學習造出了推理模型,這類模型擅長數學等任務,但更慢、更貴。

RLCD

面向校準決策的強化學習訓練 TypeSafe 返回決策和校準過的機率,而不是生成的文本。

RLHF 曾被用來訓練 InstructGPT 和 ChatGPT,它由 TypeSafe 聯合創始人 Diogo Almeida 參與發明。

預訓練語言模型分出被弱化的 RLHF 與 RLVR 兩條路線,以及被著重強調的 RLCD 決策模型路線。

RLCD 與校準過的決策

RLCD 最佳化的是一份不同的輸出契約:

  • 模型不生成文本。
  • 它返回決策和機率。
  • 機率越高,答案正確的可能性就應該越大。

校準讓不確定性變得可供軟體使用。對於一個校準良好的模型的大量預測:

  • 被賦予 0.2 機率的結果,大約應該有 20% 的時候發生。
  • 被賦予 0.8 機率的結果,大約應該有 80% 的時候發生。
  • 被賦予 1.0 機率的結果,應該 100% 發生。

這些比率描述的是成組的預測,並不保證任何單個答案。關於軟體何時該行動、何時該升級,見置信度。

RLHF 的問題

RLHF 教模型說人們偏好的話。這個目標對聊天機器人很好用,但它也可能獎勵諂媚,以及聽起來很篤定的幻覺。

偏好最佳化還會導致模式丟失(mode dropping):模型學會偏好某種特定風格(比如遵循指令),同時降低其它可能輸出的機率。

基礎模型的機率分佈,與經過 RLHF 後收窄、發生模式丟失的分佈之對比。

模式丟失是模式崩潰(mode collapse)的溫和版本。在經典的生成對抗網路失效模式裡,生成器學會反覆產出同一種輸出,因為那種輸出能持續騙過判別器。

模式崩潰的類比
重複的字元展示了一個陷入模式崩潰的 GAN。

RLHF 仍然很適合對話模型。TypeSafe 的立場是:生產自動化需要不同的訓練目標 —— 一個以受限決策和校準過的不確定性為中心的目標。