文档导航

决策模型实践指南

这些页面回答三个问题:

  • 真实项目里,大家实际怎么用它?
  • 哪些做法反复出现,哪些是踩过坑之后才改成的样子?
  • 官方讲不清或没讲的那部分 —— 尤其是概率到底可不可信 —— 现在有多少证据?

下面每一页的数字都来自公开可查的一手记录:独立复算、预注册实验,或者项目自己 公布的产物。哪一条属于哪一种,正文里会说清楚 —— 因为这三样的分量完全不同。

主线

Jev 和 Laya 这类模型有一个很好懂、也很容易被过度推销的性质:输出的形状是有保证的。 你要一个 Choice,拿回来的必定是选项之一加一个概率;要 Noul,拿回来的必定是 一个 0 到 1 的数。没有需要解析的文本,所以也就没有「模型吐了一段废话导致程序崩掉」 这件事。

但那是类型安全,不是概率可信。后者是另一回事,而且目前是被公开质疑的:

  • 有独立复算发现,Score 题返回的 confidence 经常正好等于分数的小数部分 (121 个此类输出高度集中)—— 那更像是 wire 格式的产物,而不是一个校准过的概率。
  • 有公开实验让 Jev 猜一颗公平骰子 400 次,它 400 次全选同一个面, 平均自报概率 82.9%,而实际正确率是 19.0%。
  • 有独立的分布外(OOD)校准测试给出了偏差的方向:Choice 与 Score 系统性过度自信, Boolean 系统性自信不足。

所以下面每一页都反复回到同一句话:把置信度当作待校准的先验,而不是保证。 下面每一页都在讲这件事在具体场景里意味着什么。

怎么读这些数字

下面这些数字有三种来源,正文会尽量说清是哪一种:

来源 含义 该怎么用
项目自报 作者在自己的 README 或博客里给出的结果 当作线索,不要当作结论
独立复算 第三方在公开数据上重跑,或给出可复算的产物 可以引用,但仍要看样本量
预注册 先定判据再跑,结果(包括否定的)照发 这一类最值得看

这一区分不是吹毛求疵。同一个模型既出现在「准确率超过 Jev」的项目自报里, 也出现在「打不过向量检索」的独立负结果里 —— 两者都是真的,差别在于谁测的、测了多少。