決策模型實踐指南
這些頁面回答三個問題:
- 真實專案裡,大家實際怎麼用它?
- 哪些做法反覆出現,哪些是踩過坑之後才改成的樣子?
- 官方講不清或沒講的那部分 —— 尤其是機率到底可不可信 —— 現在有多少證據?
下面每一頁的數字都來自公開可查的一手記錄:獨立復算、預註冊實驗,或者專案自己 公佈的產物。哪一條屬於哪一種,正文裡會說清楚 —— 因為這三樣的分量完全不同。
主線
Jev 和 Laya 這類模型有一個很好懂、也很容易被過度推銷的性質:輸出的形狀是有保證的。
你要一個 Choice,拿回來的必定是選項之一加一個機率;要 Noul,拿回來的必定是
一個 0 到 1 的數。沒有需要解析的文本,所以也就沒有「模型吐了一段廢話導致程式崩掉」
這件事。
但那是型別安全,不是機率可信。後者是另一回事,而且目前是被公開質疑的:
- 有獨立復算發現,
Score題返回的confidence經常正好等於分數的小數部分 (121 個此類輸出高度集中)—— 那更像是 wire 格式的產物,而不是一個校準過的機率。 - 有公開實驗讓 Jev 猜一顆公平骰子 400 次,它 400 次全選同一個面, 平均自報機率 82.9%,而實際正確率是 19.0%。
- 有獨立的分佈外(OOD)校準測試給出了偏差的方向:
Choice與Score系統性過度自信,Boolean系統性自信不足。
所以下面每一頁都反覆回到同一句話:把置信度當作待校準的先驗,而不是保證。 下面每一頁都在講這件事在具體場景裡意味著什麼。
怎麼讀這些數字
下面這些數字有三種來源,正文會盡量說清是哪一種:
| 來源 | 含義 | 該怎麼用 |
|---|---|---|
| 專案自報 | 作者在自己的 README 或部落格裡給出的結果 | 當作線索,不要當作結論 |
| 獨立復算 | 第三方在公開資料上重跑,或給出可復算的產物 | 可以引用,但仍要看樣本量 |
| 預註冊 | 先定判據再跑,結果(包括否定的)照發 | 這一類最值得看 |
這一區分不是吹毛求疵。同一個模型既出現在「準確率超過 Jev」的專案自報裡, 也出現在「打不過向量檢索」的獨立負結果裡 —— 兩者都是真的,差別在於誰測的、測了多少。