AI 入門
為什麼 TypeSafe 訓練的是帶校準機率的決策模型,而不是去最佳化生成的文本。
大多數 AI 產品都圍繞「模型與人對話」來構建。TypeSafe 從一個不同的判斷出發:大規模自動化將主要由 AI 對 AI、AI 對軟體的互動構成,所以機器介面比聊天介面更重要。
我們把這叫做 Machine Native Intelligence:
具備軟體式特性的 AI —— 結構化、可靠、可觀測、可測試、快、一致,而且成本低。
構建生產系統,而不是造神
TypeSafe 並不想造一個什麼都能做的模型。它面向的是生產系統 —— 在那裡,程式碼只需要一個範圍明確的決策,供它檢查並據此行動。
我們的預期是:大規模 AI 自動化會接近 99% 的機器對機器互動、1% 的人機互動。這就把設計目標從「讀起來舒服的回覆」轉向「在軟體裡行為可預測的輸出」。
讀一讀 TypeSafe 宣言。
三種後訓練路線
預訓練語言模型主要有兩種改造方式。TypeSafe 加了第三種。這裡列出 RLHF 和 RLVR 是為了給個參照;TypeSafe 的訓練路線是 RLCD。
RLHF
基於人類反饋的強化學習把預訓練模型變成了聊天機器人。它訓練模型產出人們更偏好的回覆。
RLVR
帶可驗證獎勵的強化學習造出了推理模型,這類模型擅長數學等任務,但更慢、更貴。
RLCD
面向校準決策的強化學習訓練 TypeSafe 返回決策和校準過的機率,而不是生成的文本。
RLHF 曾被用來訓練 InstructGPT 和 ChatGPT,它由 TypeSafe 聯合創始人 Diogo Almeida 參與發明。


RLCD 與校準過的決策
RLCD 最佳化的是一份不同的輸出契約:
- 模型不生成文本。
- 它返回決策和機率。
- 機率越高,答案正確的可能性就應該越大。
校準讓不確定性變得可供軟體使用。對於一個校準良好的模型的大量預測:
- 被賦予
0.2機率的結果,大約應該有 20% 的時候發生。 - 被賦予
0.8機率的結果,大約應該有 80% 的時候發生。 - 被賦予
1.0機率的結果,應該 100% 發生。
這些比率描述的是成組的預測,並不保證任何單個答案。關於軟體何時該行動、何時該升級,見置信度。
RLHF 的問題
RLHF 教模型說人們偏好的話。這個目標對聊天機器人很好用,但它也可能獎勵諂媚,以及聽起來很篤定的幻覺。
偏好最佳化還會導致模式丟失(mode dropping):模型學會偏好某種特定風格(比如遵循指令),同時降低其它可能輸出的機率。


模式丟失是模式崩潰(mode collapse)的溫和版本。在經典的生成對抗網路失效模式裡,生成器學會反覆產出同一種輸出,因為那種輸出能持續騙過判別器。
模式崩潰的類比


RLHF 仍然很適合對話模型。TypeSafe 的立場是:生產自動化需要不同的訓練目標 —— 一個以受限決策和校準過的不確定性為中心的目標。