公开质疑与没复现出来的结果
上一篇讲的是「怎么补救校准」。这一页讲的是为什么需要补救 —— 把散落在社区里的公开反面证据集中起来,因为它们通常不会出现在项目主页上。
看这一页的正确姿势不是「所以这个模型不行」,而是: 这些是已知的失败模式,你的系统要能扛住它们。
骰子实验
最直观的一个。让 Jev 猜一颗公平的骰子,跑 400 次:
| 项 | 结果 |
|---|---|
| 它选了哪个面 | 400 次全是同一个面 |
| 平均自报概率 | 82.9% |
| 实际正确率 | 19.0% |
这组数字同时说明了两件事。第一,自报概率可以是完全没有信息的 —— 82.9% 这个数在一个实际命中率 19% 的任务上没有携带任何可靠信息。 第二,它不表达「我不知道」。一颗公平骰子的问题上,正确答案是 「六个面各约 16.7%」,而模型的输出形态(一个偏好的选项加一个高概率) 让它没法表达这件事。
同一个作者的另一个结果也值得记:在一份合成的预测文档上,
30% 的短缺风险经过 Choice 变成了 5.3%,经过 Noul 变成 26.7%。
同一份输入、同一个意思,换一个原语问,得到的数差了五倍 ——
这说明原语的选择本身会改变结论(这一点在评测那一页
还有一条更硬的证据)。
「Jev Can’t Be Calibrated」
一篇流传较广的批评文章给出的论证是统计层面的:校准的宣称在现有证据下站不住。 与之呼应的是一个高赞讨论里的表述,可以概括为:
类型安全的保证是真的(多方验证过),但校准的宣称目前没有公开的 ECE 或 reliability curve 支撑。
注意这个表述的分寸:它没有说校准是假的,而是说支撑它的公开证据缺失。 这两件事不一样,而对做工程决策的人来说,结论是一样的 —— 你不能拿一个没有公开可靠性曲线的东西去定生产阈值。
重排:一个完整的负结果
这一类结果最有价值,因为它具体、可复算、而且否定的正是「这个模型什么都能做」的暗示。
一个重排评测用了 33,047 个条目、164 个真实查询、9,831 个已评对, 结论是纯决策模型的重排打不过向量检索。
这里的价值在于规模:三万多条目、一百多个真实查询,不是玩具设置。 而它否定的用途(语义重排)恰好是最容易被认为是「分类问题的变体、 顺手就能做」的那一类。
一个分裂判决
有些结果的方向取决于你看哪一行。一个生成与评分的对比:
在日文 NLI 上,多维打分 + 本地拟合权重赢了直接提问(0.9076 vs 0.8373)。 但它把大约 25 倍多的困难良性样本误标成了攻击(37.2% vs 1.5%)。
平均指标变好了,而某一类样本的误报率涨了 25 倍。如果你的系统里 「误标良性输入」的代价很高,这个改进对你是负的 —— 尽管它看起来是正的。
还有一份预注册的实验(先定判据、再跑、结果无论正负都发), 在不同数据集上给出了方向不一致的判决 —— 一边过,一边不过。
厂商自己的文档也在承认这件事
官方的「模型锯齿」文档明确列出了当前公开版本已知的失败模式。 这条不是反面证据,但它的存在本身说明: 「这个模型在某些任务上表现很差」是官方立场的一部分,不是秘密。
怎么用这一页
把这些结论变成三条工程规则:
- 不要用置信度的绝对值做任何跨任务推理。 「0.9 表示 90% 正确」在骰子 那种任务上直接是错的。
- 原语的选择是一个实验变量,不是一个风格选择。 同一个问题用
Choice还是Noul问,可能得到差五倍的结论 —— 要把这个差异测出来, 而不是随手选一个。 - 看子类,不看总分。 上面那个 25 倍误报的例子,在总分上是完全看不见的。
一句话
这些批评不构成「不要用」的理由 —— 它们构成不要相信默认值的理由。 这个栏目里其他页讲的所有模式(代码持有阈值、门控、conformal 弃权), 本质上都是在这一页的约束下工作的。