ドキュメント

意思決定モデルをどう評価するか

このページは実務的な問いに答えます。二つの数字が食い違ったとき、どちらを信じるか。

公開評価の形

まず第三者が再実行できるものから。数字よりも設計が参考になります。

選択肢のシャッフルと複数回実行。 解答と再実行ツールを公開している評価は、 108 問の四択、文書もツールもなし、各問 3 回・選択肢の順序をシャッフル、 当てずっぽうの基準は 25% です。報告されているのは、現行の公開モデルが 84.6%、 199 ms(中央値)、$0.0088 であるのに対し、比較対象の最強モデルは 98.0% だが 2.12 秒、$1.59。

⚠️ この二つの金額の単位は原文に明記されていません(per full run と書かれています)。 1 回あたりの単価として計算しないでください。

要点はどちらが勝つかではなく、三つの軸がすべて並んでいることです。 84.6% と 199 ms、98.0% と 2.12 秒は、どちらかが劣っているのではなく 別の製品です。

シャッフルは一つのことを測るためにあります。 モデルが選択肢の順序に敏感なら、 本番では不安定な部品です。この評価はその軸を報告しています。

基底率は天井です。 別の独立したリーダーボードは PubMedQA、Banking77、 HelpSteer2 を各問 300 件 × 5 回で回し、決定ごとの確率を CC BY 4.0 で公開しています。 その二つの所見が重要です。

  • PubMedQA では同点首位、しかもコストは 1/28。
  • HelpSteer2 では、どのモデルもラベルの基底率を超えられなかった。

二つ目はこういう意味です。そのデータセットでは「最も多いラベルを常に選ぶ」が 強いベースラインであり、それを超えたモデルはありません。 その状況で首位という順位は何も証明しません —— 測っているのはラベル分布です。

不正な出力を誤りとして数える。 あるベンチマークは「畸形な確率分布を返した」 場合を明示的に miss とします。些細に見えますが、異なるモデルのスコアを 並べて比べてよいかどうかを決める話です —— 不正な値を出せるモデルの精度は 意味を持ちません。

統計的な比較:数字の大小では決まらない

84.6% と 85.1% は、本当に優劣でしょうか。

そうとは限りません。 n=100 なら完全にノイズの範囲です。実際に使われている 検定の一つが McNemar 検定です。これは同じ問題集合上で二つのモデルが 意見を違えた事例を比べるもので、総合スコアを比べるものではありません。

ある再実装は 256 件の公開判断で元の回答を再生し、 231 対 238、McNemar p = 0.21 を得て、元のモデルと有意差なしと結論しました。 「有意差なし」は完全に妥当な結論であり、「より近づいた」と言い張るより ずっと有用です。

より厳しいやり方が事前登録です。基準を先に固定してから実行します。 ある順位付けベンチマークがそうしており、「20 Newsgroups では通るが、 Amazon ESCI の六条件のうち四つで通らない」と報告しました。 この半々の結果は全通過より信頼できます。基準が実際に機能している証拠だからです。

自己申告の数字に潜む四つの罠

実際のプロジェクトでは、自分でデータを一つ回して数字を出すのが普通です。 その数字には四つの決まった罠があります。

① 問題の形そのものが結果を変える。 ある調査型の実験が、硬い比較を出しています。yes/no の問いを Noul で書くか Choice で書くかの影響は、Jev と GPT-4.1 の差より大きい。 つまり多くの「A が B より良い」という結論で実際に効いているのは、 問いの書き方かもしれません。プリミティブを変えたら測り直す必要があります。

② 一回だけ、小標本、分散なし。 「攻撃遮断率 100%」という自己申告が 10 件に基づいているかもしれません。 同じ領域で再現可能なプロジェクトは「敵対的サンプル 50 件で反転 0 件」のように 分母つきで報告しています。分母が信頼度です。

③ 呼び出し間のゆらぎ。 意思決定モデルを電卓として使うプロジェクト(1 文字ごとに 13 の選択肢から 選ばせる)は、同じ入力に対する二回の呼び出しのゆらぎを見せる Rerun ボタンを わざわざ用意しています。ゆらぎ自体は恐ろしくありません。 知らないことの方が恐ろしい —— 測ったしきい値が別の瞬間には成立しないかもしれない ということです。

④ 専用モデルのホームでの強さは普遍的勝利ではない。 706,048 パラメータ(2.8 MB)の専用モデルは、自分のフォーム入力タスクで 99.7%、 汎用モデルは同じ項目で 83.6% です。著者自身がこう書いています。 「ホームグラウンドの専門家であって、一般的な勝利ではない」。 この一文は、あらゆる「Jev を超えた」項目の既定の読み方であるべきです。

一文で

評価の価値は分母に、分散に、部分クラスにあります。総合点にはありません。 標本数と選択肢順の検査と負の結果を備えた 60 点は、それらを欠いた 95 点より 価値があります。