Cookbooks
Cookbooks
実際の問題で TypeSafe を使う様子を、いくつかの質問から本格的なパイプラインまで、端から端まで示すレシピ集です。
各 cookbook は実例です。実データセット、それについて何かを判断する TypeSafe の質問、そしてその意思決定を動くシステムに変えるコードで構成されます。プリミティブとパターンが具体的な問題でどう組み合わさるかを見たいときに 1 つ読んでみてください。自分のシステムの出発点としてコピーするのもよいでしょう。
このセクションは、TypeSafe のプリミティブを知り、信頼度の仕組みを理解していることを前提としています。そうでなければ、先にそちらを読んでください。
自己整合性
同じ意思決定を繰り返し、実行間の一致をシグナルとして使います。
| Cookbook | 内容 | レベル |
|---|---|---|
| 自己整合性:noul | 不確かな確率を人手レビューに回しつつ、基になる noul の値を可視化したままにします。 | 初級 |
| 自己整合性:choice | モデレーションの意思決定に「不確か」という結果を加え、ラベルの一致率と自動処理の割合を比較します。 | 初級 |
バッチ処理
多くの質問を 1 回のリクエストにまとめます。
| Cookbook | 内容 | レベル |
|---|---|---|
| 質問の並列実行 | GDPR の Wikipedia 記事に対して 13 問の規制ブリーフィングを実行し、すべての質問を 1 回の TypeSafe 呼び出しにまとめると、答えを変えずに 12.2 倍安く、10.0 倍速くなることを示します。 | 初級 |
ハウツー
よくあるタスクのためのレシピ:検索、整形、ツール選択、ガードレール。
| Cookbook | 内容 | レベル |
|---|---|---|
| 再ランキング | 40 件の CLERC 法律クエリに対して 30 パッセージの BM25 候補リストを作り、クエリと候補の各ペアに 1 問の TypeSafe 質問を使って、top-1 精度を 5% から 18% に、top-10 精度を 38% から 62% に引き上げます。 | 初級 |
| 行単位の検索 | GitHub の利用規約に対する意味検索を構築します。1 回のリクエストで、218 個の行 ID を平易な言葉のクエリに対して Choice 質問でスコアリングし、Noul 質問で文書に答えが含まれるかを確認します。 | 初級 |
| 構造の復元 | 整形を失ったプレーンテキストから Markdown を 2 回のリクエストで復元します。1 つはハードラップされた行をつなぎ直し、もう 1 つは各ブロック(見出し、リスト、コード、コールアウト)を分類します。 | 初級 |
| 関数呼び出し | 関数名と閉じた集合の引数を、信頼度を扱える TypeSafe の質問に対応付けることで、自然言語の取引リクエストを通常の型付き関数の呼び出しに変換します。 | 中級 |
| スキル提案 | Nous Research の Hermes カタログにある 182 個のスキルから、エージェントの 1 ターンに対して最大 1 つを選びます。2 回の TypeSafe リクエストで上位候補を順位付けし、再確認します。 | 中級 |
| 知識グラフのエンティティアラインメント | 2 つのビールカタログから得た 450 組の候補ペアのうち、どれが同じ製品を指すかを、1 問の Score 質問と、どのフィールドが食い違うかを示す 3 問の付随する Noul で判定します。 | 初級 |
| RAG パッセージの分類 | 取得した各パッセージを 1 回の TypeSafe リクエストでスコアリングし、どのパッセージを回答モデルに渡すかをコード側で決めます。 | 中級 |
| 引用のダブルチェック | 出典文書と突き合わせて、誤った引用や幻覚による引用を検出します。1 問の Choice 質問が、引用の文脈が主張を支えているかを判定します。 | 初級 |
| LLM のガードレール | LLM アプリに入るメッセージと出るメッセージをすべて 1 回の TypeSafe リクエストで検査し、危険の確率と深刻度にしきい値を設けて、通過・レビュー・ブロック・振り分けを判断します。 | 中級 |
抽出
乱雑なテキストから型付きの値を取り出します。
| Cookbook | 内容 | レベル |
|---|---|---|
| SDE カスケード | 2 段階の構造化データ抽出カスケード(mini → verify → reasoning)を使い、大規模な推論モデルの品質の大半を、そのごく一部のコストで得ます。 | 中級 |
| 日付の抽出 | 文書に記載された部分を TypeSafe に問い合わせて絶対日付と相対日付を抽出し、コード側で解決・検証し、信頼度に基づくレビューを行います。 | 初級 |
| 事前パース済みの値抽出 | 正規表現で候補となるメールアドレス・電話番号・金額を見つけ、TypeSafe に要求された範囲を選択させて、コードが逐語的な値を正規化できるようにします。 | 初級 |
分類
入力を任意の深さのカテゴリに割り当てます。
| Cookbook | 内容 | レベル |
|---|---|---|
| 階層分類 | 特許・小売製品・生体医学・ソースコードの深い階層を、TypeSafe の Choice 確率分布に対する並列ビームサーチで分類します。 | 中級 |
| 自動リサーチによる特徴量の探索 | TypeSafe の質問を提案し、自由記述を数値特徴量に変換し、モデルの誤りを使って教師ありの CatBoost 回帰器を改善する自動リサーチのループを実行します。 | 上級 |
| 信頼度を使った分類 | SEC の年次報告書を 75 の業種グループに 1 問ずつの Choice で分類し、その答え自身の信頼度を読んで、そのグループを報告するか、上位のより広い部門を報告するかを決めます。 | 初級 |