文件導航

決策模型實踐指南

這些頁面回答三個問題:

  • 真實專案裡,大家實際怎麼用它?
  • 哪些做法反覆出現,哪些是踩過坑之後才改成的樣子?
  • 官方講不清或沒講的那部分 —— 尤其是機率到底可不可信 —— 現在有多少證據?

下面每一頁的數字都來自公開可查的一手記錄:獨立復算、預註冊實驗,或者專案自己 公佈的產物。哪一條屬於哪一種,正文裡會說清楚 —— 因為這三樣的分量完全不同。

主線

Jev 和 Laya 這類模型有一個很好懂、也很容易被過度推銷的性質:輸出的形狀是有保證的。 你要一個 Choice,拿回來的必定是選項之一加一個機率;要 Noul,拿回來的必定是 一個 0 到 1 的數。沒有需要解析的文本,所以也就沒有「模型吐了一段廢話導致程式崩掉」 這件事。

但那是型別安全,不是機率可信。後者是另一回事,而且目前是被公開質疑的:

  • 有獨立復算發現,Score 題返回的 confidence 經常正好等於分數的小數部分 (121 個此類輸出高度集中)—— 那更像是 wire 格式的產物,而不是一個校準過的機率。
  • 有公開實驗讓 Jev 猜一顆公平骰子 400 次,它 400 次全選同一個面, 平均自報機率 82.9%,而實際正確率是 19.0%。
  • 有獨立的分佈外(OOD)校準測試給出了偏差的方向:Choice 與 Score 系統性過度自信, Boolean 系統性自信不足。

所以下面每一頁都反覆回到同一句話:把置信度當作待校準的先驗,而不是保證。 下面每一頁都在講這件事在具體場景裡意味著什麼。

怎麼讀這些數字

下面這些數字有三種來源,正文會盡量說清是哪一種:

來源 含義 該怎麼用
專案自報 作者在自己的 README 或部落格裡給出的結果 當作線索,不要當作結論
獨立復算 第三方在公開資料上重跑,或給出可復算的產物 可以引用,但仍要看樣本量
預註冊 先定判據再跑,結果(包括否定的)照發 這一類最值得看

這一區分不是吹毛求疵。同一個模型既出現在「準確率超過 Jev」的專案自報裡, 也出現在「打不過向量檢索」的獨立負結果裡 —— 兩者都是真的,差別在於誰測的、測了多少。