ドキュメント

公開の批判と、再現しなかった結果

前のページは校正の直し方でした。このページはなぜ直す必要があるのか —— コミュニティに散らばる公開の反証を集めたものです。プロジェクトのトップページには まず載らない類のものです。

読み方として正しいのは「だからこのモデルは駄目だ」ではなく、 これらは既知の失敗モードであり、あなたのシステムは耐えなければならない、という意味です。

サイコロ実験

最も分かりやすいものです。公平なサイコロを当てさせ、400 回試行しました。

項目 結果
選んだ面 400 回とも同じ面
平均の自己申告確率 82.9%
実際の的中率 19.0%

この数字は同時に二つのことを言っています。第一に、自己申告の確率は まったく情報を持たないことがある —— 的中率 19% の課題において 82.9% は何も伝えていません。第二に、モデルは「分からない」を表現しません。 公平なサイコロの正解は「各面およそ 16.7%」であり、 「好ましい選択肢が一つと高い確率」という出力の形ではそれが言えません。

同じ著者のもう一つの結果も記録に値します。合成された予測文書において、 30% の供給不足リスクが Choice では 5.3% に、Noul では 26.7% になった。 同じ入力、同じ意味で、プリミティブを変えると 5 倍違う —— プリミティブの選択そのものが結論を変えます (評価のページにもっと強い証拠があります)。

「Jev Can’t Be Calibrated」

広く読まれた批評は、統計の水準で校正の主張が現存する証拠では成り立たないと論じています。 高く評価された議論は、同じ点をより慎重に述べています。

型安全性の保証は本物である(複数の方向から検証されている)。 しかし校正の主張を支える公開の ECE や reliability curve は存在しない。

この慎重さが重要です。校正が偽だとは言っておらず、 それを支える公開の証拠が欠けていると言っています。この二つは違う主張ですが、 エンジニアリング上の判断としては同じ場所に着きます —— 公開された信頼性曲線のないものに、本番のしきい値を設定することはできません。

順位付け:完全な負の結果

この種の結果が最も価値があります。具体的で、再現可能で、 そして「何でもできる」という含意をちょうど否定しているからです。

ある再順位付けの評価は 33,047 件の項目、164 件の実クエリ、9,831 の評価済みペアを使い、 純粋な意思決定モデルによる再順位付けはベクトル検索に勝てないと結論しました。

規模が要点です。三万余件と百件を超える実クエリは、おもちゃの設定ではありません。 そして否定された用途(意味的な再順位付け)は、分類の延長で無料で付いてくると 考えられやすいものまさにそのものです。

分裂した判決

結果がどの行を読むかで変わるものもあります。ある採点と生成の比較では、

日本語 NLI では、多次元採点とローカルでフィットした重みが直接質問を上回った (0.9076 対 0.8373)。しかし、難しい良性の行を攻撃として誤って印付けた数は およそ 25 倍だった(37.2% 対 1.5%)。

平均は改善し、あるクラスの誤検知率は 25 倍になりました。 良性の入力を誤って止めるコストが高いシステムでは、この改善はあなたにとって負です —— 見た目は正でも。

事前登録された実験(先に判定基準を固定し、結果がどちらでも公開する)もあり、 データセットによって判定が割れています。一方は通り、他方は通りませんでした。

ベンダー自身の文書も認めている

公式の「model jaggedness」ページは、現行の公開バージョンの既知の失敗モードを 明示しています。これは反証ではありませんが、その存在自体が何かを語ります。 「このモデルは一部のタスクで大きく失敗する」ことは、公式の立場の一部であり、 秘密ではありません。

このページをルールにする

三つのエンジニアリングルールが導かれます。

  1. 信頼度の絶対値からタスクをまたいだ推論をしない。 「0.9 は 90% 正しい」は、 サイコロのようなタスクでは単純に偽です。
  2. プリミティブの選択は実験変数であり、様式の選択ではない。 同じ問いを Choice で聞くか Noul で聞くかで 5 倍違いえます。差を測ってください。
  3. 部分クラスを見る。全体のスコアを見ない。 25 倍の誤検知の例は、 総計では完全に見えません。

一文で

これらの批判は「使うな」の理由にはなりません。既定値を信じるなという理由です。 このガイドの他のページにあるパターン(しきい値はコードが持つ、ゲーティング、 conformal 棄権)は、すべてこのページの制約の下で機能する方法です。