公開質疑與沒復現出來的結果
上一篇講的是「怎麼補救校準」。這一頁講的是為什麼需要補救 —— 把散落在社群裡的公開反面證據集中起來,因為它們通常不會出現在專案主頁上。
看這一頁的正確姿勢不是「所以這個模型不行」,而是: 這些是已知的失敗模式,你的系統要能扛住它們。
骰子實驗
最直觀的一個。讓 Jev 猜一顆公平的骰子,跑 400 次:
| 項 | 結果 |
|---|---|
| 它選了哪個面 | 400 次全是同一個面 |
| 平均自報機率 | 82.9% |
| 實際正確率 | 19.0% |
這組數字同時說明了兩件事。第一,自報機率可以是完全沒有資訊的 —— 82.9% 這個數在一個實際命中率 19% 的任務上沒有攜帶任何可靠資訊。 第二,它不表達「我不知道」。一顆公平骰子的問題上,正確答案是 「六個面各約 16.7%」,而模型的輸出形態(一個偏好的選項加一個高機率) 讓它沒法表達這件事。
同一個作者的另一個結果也值得記:在一份合成的預測文件上,
30% 的短缺風險經過 Choice 變成了 5.3%,經過 Noul 變成 26.7%。
同一份輸入、同一個意思,換一個原語問,得到的數差了五倍 ——
這說明原語的選擇本身會改變結論(這一點在評測那一頁
還有一條更硬的證據)。
「Jev Can’t Be Calibrated」
一篇流傳較廣的批評文章給出的論證是統計層面的:校準的宣稱在現有證據下站不住。 與之呼應的是一個高贊討論裡的表述,可以概括為:
型別安全的保證是真的(多方驗證過),但校準的宣稱目前沒有公開的 ECE 或 reliability curve 支撐。
注意這個表述的分寸:它沒有說校準是假的,而是說支撐它的公開證據缺失。 這兩件事不一樣,而對做工程決策的人來說,結論是一樣的 —— 你不能拿一個沒有公開可靠性曲線的東西去定生產閾值。
重排:一個完整的負結果
這一類結果最有價值,因為它具體、可復算、而且否定的正是「這個模型什麼都能做」的暗示。
一個重排評測用了 33,047 個條目、164 個真實查詢、9,831 個已評對, 結論是純決策模型的重排打不過向量檢索。
這裡的價值在於規模:三萬多條目、一百多個真實查詢,不是玩具設定。 而它否定的用途(語義重排)恰好是最容易被認為是「分類問題的變體、 順手就能做」的那一類。
一個分裂判決
有些結果的方向取決於你看哪一行。一個生成與評分的對比:
在日文 NLI 上,多維打分 + 本地擬合權重贏了直接提問(0.9076 vs 0.8373)。 但它把大約 25 倍多的困難良性樣本誤標成了攻擊(37.2% vs 1.5%)。
平均指標變好了,而某一類樣本的誤報率漲了 25 倍。如果你的系統裡 「誤標良性輸入」的代價很高,這個改進對你是負的 —— 儘管它看起來是正的。
還有一份預註冊的實驗(先定判據、再跑、結果無論正負都發), 在不同資料集上給出了方向不一致的判決 —— 一邊過,一邊不過。
廠商自己的文件也在承認這件事
官方的「模型鋸齒」文件明確列出了當前公開版本已知的失敗模式。 這條不是反面證據,但它的存在本身說明: 「這個模型在某些任務上表現很差」是官方立場的一部分,不是秘密。
怎麼用這一頁
把這些結論變成三條工程規則:
- 不要用置信度的絕對值做任何跨任務推理。 「0.9 表示 90% 正確」在骰子 那種任務上直接是錯的。
- 原語的選擇是一個實驗變數,不是一個風格選擇。 同一個問題用
Choice還是Noul問,可能得到差五倍的結論 —— 要把這個差異測出來, 而不是隨手選一個。 - 看子類,不看總分。 上面那個 25 倍誤報的例子,在總分上是完全看不見的。
一句話
這些批評不構成「不要用」的理由 —— 它們構成不要相信預設值的理由。 這個欄目裡其他頁講的所有模式(程式碼持有閾值、門控、conformal 棄權), 本質上都是在這一頁的約束下工作的。