ドキュメント

意思決定モデル実践ガイド

これらのページが答えるのは三つの問いです。

  • 実プロジェクトで、実際にはどう使われているのか
  • 繰り返し現れるやり方のうち、どれが「誰かが痛い目を見たから」生まれたものなのか
  • ドキュメントでは決着できない部分 —— とりわけ確率が信じられるのか —— について、 いま何が言えるのか

以下のページの数字はすべて、公開された一次記録に基づいています。独立した再計算、 事前登録された実験、あるいはプロジェクト自身が公開した成果物です。どれに当たるかは 本文に書きます —— この三つは重みがまったく違うからです。

貫く一本の線

Jev や Laya には、分かりやすく、そして過大に宣伝されやすい性質があります。 出力の形が保証されているということです。Choice を求めれば選択肢の一つと確率が、 Noul を求めれば 0 から 1 の数が返ります。パースすべきテキストがないので、 「モデルが長々と喋ってプログラムが落ちる」こともありません。

しかしそれは型安全性であって、確率の校正ではありません。後者は別の主張で、 現在は公開の場で争われています。

  • 独立に再計算したところ、Score の質問で返る confidence はしばしば スコアの小数部分そのものでした(そうした出力が 121 件、密集している)。 校正された確率というより、wire 形式の産物に見えます。
  • 公平なサイコロを 400 回当てさせる公開実験では、400 回とも同じ面を選び、 自己申告の確率は平均 82.9%、実際の的中率は 19.0% でした。
  • 独立した分布外(OOD)校正テストは、誤差の向きを報告しています。 Choice と Score は体系的に過信、Boolean は体系的に自信不足です。

つまり以下のページはどれも、同じ一文に戻ります。信頼度は校正すべき事前分布として 扱うのであって、保証として扱わない。 以下のページはすべて、それが具体的な場面で 何を意味するかを扱います。

数字の読み方

以下の数字には出どころが三種類あり、本文はどれかを示すようにしています。

出どころ 意味 使い方
プロジェクトの自己申告 作者自身の README やブログにある結果 手がかりであって結論ではない
独立の再計算 第三者が再実行した、あるいは再実行できる成果物を公開した 引用できるが、標本数は確認する
事前登録 先に判定基準を決め、否定された結果も含めて公開 最も参考になる

この区別は揚げ足取りではありません。同じモデルが「Jev に勝った」という自己申告にも、 「ベクトル検索に勝てなかった」という独立の否定的結果にも現れます。どちらも本当で、 違いは誰が、どれだけ測ったかです。