意思決定モデル実践ガイド
これらのページが答えるのは三つの問いです。
- 実プロジェクトで、実際にはどう使われているのか
- 繰り返し現れるやり方のうち、どれが「誰かが痛い目を見たから」生まれたものなのか
- ドキュメントでは決着できない部分 —— とりわけ確率が信じられるのか —— について、 いま何が言えるのか
以下のページの数字はすべて、公開された一次記録に基づいています。独立した再計算、 事前登録された実験、あるいはプロジェクト自身が公開した成果物です。どれに当たるかは 本文に書きます —— この三つは重みがまったく違うからです。
貫く一本の線
Jev や Laya には、分かりやすく、そして過大に宣伝されやすい性質があります。
出力の形が保証されているということです。Choice を求めれば選択肢の一つと確率が、
Noul を求めれば 0 から 1 の数が返ります。パースすべきテキストがないので、
「モデルが長々と喋ってプログラムが落ちる」こともありません。
しかしそれは型安全性であって、確率の校正ではありません。後者は別の主張で、 現在は公開の場で争われています。
- 独立に再計算したところ、
Scoreの質問で返るconfidenceはしばしば スコアの小数部分そのものでした(そうした出力が 121 件、密集している)。 校正された確率というより、wire 形式の産物に見えます。 - 公平なサイコロを 400 回当てさせる公開実験では、400 回とも同じ面を選び、 自己申告の確率は平均 82.9%、実際の的中率は 19.0% でした。
- 独立した分布外(OOD)校正テストは、誤差の向きを報告しています。
ChoiceとScoreは体系的に過信、Booleanは体系的に自信不足です。
つまり以下のページはどれも、同じ一文に戻ります。信頼度は校正すべき事前分布として 扱うのであって、保証として扱わない。 以下のページはすべて、それが具体的な場面で 何を意味するかを扱います。
数字の読み方
以下の数字には出どころが三種類あり、本文はどれかを示すようにしています。
| 出どころ | 意味 | 使い方 |
|---|---|---|
| プロジェクトの自己申告 | 作者自身の README やブログにある結果 | 手がかりであって結論ではない |
| 独立の再計算 | 第三者が再実行した、あるいは再実行できる成果物を公開した | 引用できるが、標本数は確認する |
| 事前登録 | 先に判定基準を決め、否定された結果も含めて公開 | 最も参考になる |
この区別は揚げ足取りではありません。同じモデルが「Jev に勝った」という自己申告にも、 「ベクトル検索に勝てなかった」という独立の否定的結果にも現れます。どちらも本当で、 違いは誰が、どれだけ測ったかです。