ドキュメント

AI 入門

AI 入門

TypeSafe が、生成テキストの最適化ではなく、キャリブレーションされた確率を持つ意思決定モデルを訓練する理由。

ほとんどの AI 製品は、モデルと人の会話を中心に構築されています。TypeSafe は別の賭けから始めます。大規模な自動化は AI 対 AI、AI 対ソフトウェアのやり取りが支配的になるので、機械のインターフェースがチャットのインターフェースより重要になる、というものです。

私たちはこれを Machine Native Intelligence と呼びます:

構造、信頼性、可観測性、テスト容易性、速度、一貫性、低コストといったソフトウェア的な性質を持つ AI。

作るのはプロダクト、神ではない

TypeSafe は何でもできるモデルを作ろうとしているのではありません。コードが検査して行動できる狭い意思決定を必要とする本番システムのために設計されています。

私たちの予想は、大規模な AI 自動化は 99% がマシン対マシンのやり取り、1% が人とのやり取りに近づくというものです。これにより設計目標は、読んで気持ちのよい応答から、ソフトウェアの中で予測可能に振る舞う出力へ移ります。

TypeSafe マニフェストをお読みください。

三つの後訓練アプローチ

事前訓練された言語モデルは、主に二つの方法で適応されてきました。TypeSafe は三つ目を加えます。ここでは RLHF と RLVR を文脈として示します。TypeSafe の訓練経路は RLCD です。

RLHF

人間のフィードバックによる強化学習は、事前訓練モデルをチャットボットに変えました。人はより好む応答を生成するようにモデルを訓練します。

RLVR

検証可能な報酬による強化学習は、数学などのタスクが得意な推論モデルを生みましたが、より遅く、より高価です。

RLCD

キャリブレーションされた意思決定のための強化学習は、生成されたテキストではなく、意思決定とキャリブレーションされた確率を返すように TypeSafe を訓練します。

RLHF は InstructGPT と ChatGPT の訓練に使われ、TypeSafe の共同創業者である Diogo Almeida が共同発明しました。

事前訓練された言語モデルが、弱められた RLHF と RLVR の経路と、強調された RLCD 意思決定モデルの経路に分岐する様子。

RLCD とキャリブレーションされた意思決定

RLCD は異なる出力契約のために最適化します:

  • モデルはテキストを生成しません。
  • 意思決定と確率を返します。
  • より高い確率は、答えが正しいより大きな可能性に対応すべきです。

キャリブレーションは不確実性をソフトウェアが使えるものにします。よくキャリブレーションされたモデルの多数の予測にわたって:

  • 0.2 の確率が与えられた結果は、約 20% の頻度で起こるべきです。
  • 0.8 の確率が与えられた結果は、約 80% の頻度で起こるべきです。
  • 1.0 の確率が与えられた結果は、100% の頻度で起こるべきです。

これらの比率は予測の集まりを表すもので、個々の答えについての保証ではありません。ソフトウェアがいつ行動すべきか、いつエスカレーションすべきかを決める指針は信頼度を参照してください。

RLHF の問題点

RLHF は、人が好むことを言うようにモデルを教えます。その目的はチャットボットにはよく合いますが、おべっかや、自信ありげに聞こえるハルシネーションを報酬してしまうこともあります。

選好最適化はモードドロッピングも引き起こします。モデルは、指示追従など特定のスタイルを好むよう学び、その他の可能な出力の確率を下げます。

ベースモデルの確率分布と、RLHF 後に狭まり、モードドロッピングを起こした分布との比較。

モードドロッピングはモード崩壊の穏やかな版です。古典的な敵対的生成ネットワークの故障モードでは、生成器が同じ種類の出力を繰り返し生成するよう学びます。その出力が識別器を欺き続けるからです。

モード崩壊のアナロジー
繰り返される文字が、モード崩壊に陥った GAN を表している。

RLHF は対話モデルにはよく合ったままです。TypeSafe の立場は、本番の自動化には別の訓練目標 — 制約された意思決定とキャリブレーションされた不確実性を中心とした目標 — が必要だというものです。