記事のサマリー(TL;DR)
- GPT-4.1 × ReActエージェントの平均成功率77.4%に対し、5回全成功タスク(Pass⁵)は53.0%で24.4ポイントの一貫性ギャップが存在する
- IBM ResearchのConsistency Analyzerは1トレース・グラウンドトゥルース不要で「揺らぎやすい判断ポイント」を検出し、ガイドライン化する
- 一貫性ガイドライン適用後、Pass⁵は53.0%→69.0%(+16.0pp)、ギャップは24.4pt→12.0ptへ縮小し平均精度は低下しない
業務エージェントを本番運用する企業が今すぐ評価指標を見直すべき理由
金融取引の照合や契約書の義務事項チェックといったミッションクリティカルな業務では、「平均して成功する」では不十分です。同じリクエストを送るたびに結果が変わるエージェントは、業務フローとして採用できません。日本国内でもkintone・Salesforce・freeeなどのSaaSを組み合わせた業務自動化基盤にAIエージェントを組み込む動きが活発化していますが、POC段階で計測されるのはほぼ「平均成功率(Mean@k)」のみです。本番運用の信頼性を左右するPass⁵(k回全成功率)を併記・評価する習慣が国内でも必要になってきています。また、難易度が高いタスクほどギャップが拡大する(Hardタスクでは一貫性ギャップが30ptに達する)という知見は、「難しい業務ほど平均値で評価してはいけない」ことを示しており、委託先AIベンダーへの要件定義にも反映できます。
詳細
問題:ベンチマークが隠している「揺らぎ」
リハーサルでは動いたエージェントが、本番デモでは別の経路をたどって同じタスクに失敗する――これはステージ上では恥ずかしいだけですが、本番環境では信頼性の問題です。一度成功したワークフローが、ユーザーが同じリクエストを送った次の瞬間に失敗することがあります。
ほとんどのベンチマークは、この変動を平均値の陰に隠しています。AppWorldにおいてGPT-4.1を使うReActエージェントは、5回の繰り返し実行でMean@5(平均成功率)77.4% を記録しました。しかし5回すべて成功したタスクはわずか53.0% ――24.4ポイントの一貫性ギャップが存在します。ほとんどのベンチマークが報告するのは前者の数字だけです。
IBM Researchはこの「二つ目の数字」を計測し、改善する手法を構築しました。以前の投稿で紹介した ALTK-Evolve は、エージェント自身の過去のトレース(軌跡)を再利用可能なガイドラインへと自動的に蒸留し、推論時に注入するシステムです。今回の投稿では、そのALTK-Evolveに追加された新しいガイドライン種別「一貫性ガイドライン(consistency guidelines)」と、その基盤となる診断ツール「Consistency Analyzer」を紹介します。
ほぼ誰も報告しないメトリクス
標準的なエージェント評価は Mean@k を報告します。ベンチマークをk回実行して合格率を平均する手法で、リーダーボードに掲載される「77%の精度」とはこの数字を意味します。
Mean@kが答えるのは「このエージェントは平均的にどれくらい優秀か?」という問いです。実際のユーザーが気にする「同じ質問をもう一度聞いても成功するか?」には答えません。そのために必要なのが Pass^k ――k回の実行すべてでエージェントが成功するタスクの割合です。
⚠️ Pass^k と Pass@k は別物です。 Pass@k(コード生成論文などで一般的)はk回のうち少なくとも1回成功するかを問う楽観的な指標。Pass^kはその逆:すべての試行が成功しなければなりません。常に Pass^k ≤ Mean@k ≤ Pass@k の関係が成立します。
GPT-4.1を搭載したReActエージェントのMean@5は77.4%と確かに高い。しかしPass^5は53.0%にすぎません。ベンチマークの約4分の1は、タスク自体は何も変わっていないのに、エージェントが成功したり失敗したりするタスクで構成されているわけです。この差「Mean@k − Pass^k」を**一貫性ギャップ(consistency gap)**と呼びます。
これは大きなモデルに切り替えれば解決する能力の問題ではありません。能力と一貫性は直交する軸です。エージェントは能力が高くても一貫性が低いことがあります。
なぜエージェントは「揺れる」のか:シャープな分布とフラットな分布
LLMエージェントが何らかの判断を下すとき――どのAPIを呼ぶか、どの引数を渡すか、リトライするかどうか――その判断はトークンの確率分布から生まれます。重要なのはその分布の形状です。
- シャープな分布:質量が単一トークンに集中。次点候補は大差で離れており、毎回同じ選択が出やすい
- フラット(広い)分布:複数のトークンに質量が均等に分散。どちらが勝つかはほぼコイントスに近い
シャープな分布はGPUの浮動小数点非結合性やリクエストのバッチ処理といったプラットフォーム側の微小なズレには耐性があります。フラットな分布はそのような僅かな摂動に対して脆弱です。さらに、1つのトレースは数十の判断の連鎖であるため、ステップごとのわずかな揺れが複利的に積み重なり、最終的に大きなギャップになります。
グリーディデコーディングや固定シードはこの問題を解決しません。 それらは分布をトークンに変換する方法を制御するだけで、分布そのものには何も言いません。ホスト型エンドポイントでは確率がわずかに実行ごとに変化するため、temperature=0の同じプロンプトでも、今日と明日で僅差の決定が逆転することがあります。今回の評価ではReActエージェントはtemperature=0.0で動作しており、通常のサンプリング分散は一切含まれていません。
診断から修正へ:Consistency Analyzerとガイドライン生成
1. 検出 ― Consistency Analyzer
1つの記録済みトレースが与えられると、アナライザーは各判断ステップを制御されたリサンプリングによって再生し、そのポイントでモデルの出力が実際にどの程度変化するかを測定します。
具体的には、各判断ステップにつき1回の追加モデル呼び出しを行います。これはオフラインで1度だけ実行され、サンプリングパラメータをk個の補完を一度に描画するよう設定(デフォルトk=5)して発行されます。新たなツール呼び出しや環境とのインタラクションは発生せず、タスクのエンドツーエンドの再実行も必要ありません。各判断ステップの一貫性スコアが生成され、スコアカードに書き込まれることで、次の実行で揺れるリスクのある判断を正確に特定します。
検出は完全なブラックボックスです。ロジット、モデルの内部、既存のトレース以外の計装は一切不要です。
2. 生成 ― 的を絞ったガイドライン
フラグが立った各ステップが、ALTK-Evolveの標準フォーマットで一貫性ガイドラインの候補になります。以下はAppWorldのタスク「SimpleNoteのメモに記録されたバケットリストの活動数は?」のトレースからGPT-4.1が生成した実際の例です。
[ガイドライン1] ノートコンテンツのチェックボックス式マーカーをカウントする際は、プレーンな部分文字列カウントではなく行頭アンカー付き正規表現マッチを使用する――ノートタイトルが凡例行でマーカー記号を繰り返すことがあるため。
[ガイドライン2] ノートクエリの検索結果は必ず、複数マッチを確認し正しいノートを特定した上で処理を進める。
これらはタスク固有のトリビアではありません。文字列カウントのバグや未確認の検索結果は、AppWorldの多くのタスクで高い不確実性を示す判断ポイントです。アナライザーは失敗ではなく不安定性を標的にしているため、エージェントが今回たまたま正解したが次回は容易に誤る可能性があるステップを検出します。
結果:精度を犠牲にせずギャップを縮小
AppWorld test_normal(168タスク)にてGPT-4.1上のReActエージェントで評価。各タスクにつき1本のベーストレースから一貫性ガイドラインを生成し、5回の新規実行でテストしました。
| 指標 | 適用前 | 適用後 | 変化 |
|---|---|---|---|
| Mean@5(全体) | 77.4% | 81.0% | +3.6pp |
| Pass⁵(全体) | 53.0% | 69.0% | +16.0pp |
| 一貫性ギャップ | 24.4pp | 12.0pp | −12.4pp(約半減) |
一貫性ギャップはおよそ半減しました。 従来は不安定だったタスクの約3分の1が、全実行で成功するタスクへと転換しています。
難易度別では中難度・高難度タスクが最も恩恵を受けました。
- Medium(中難度):Pass⁵ +22.9pp(相対比 +44%)
- Hard(高難度):Pass⁵ +14.3pp(相対比 +45%)
- Easy(低難度):Pass⁵ +12.2pp(改善余地が最も少なかった)
Mean@5は一度も下がりませんでした。 平均精度を維持することは必須要件であり、Pass⁵を上げながらMean@5を下げるシステムは単に不信頼性をずらすだけで修正したことにはならないためです。平均精度はすべての難易度で維持または改善されました。
ガイドラインの汎化性
同じAppWorldシナリオ内の別の類似タスクに適用したところ、一貫性ガイドラインはPass⁵を+13.0pp改善しました(同一タスクの+16.0ppより3ポイント低いだけ)。あるトレースから導出されたガイドラインは、そのトレースを「パッチ」するだけでなく、転用可能な何かを捉えています。
より強い証拠はより弱いモデル(gpt-oss-120b)から得られました。同一タスクのPass⁵は10.1%→16.1%(+6.0pp)改善し、類似タスクの汎化数値(+8.7pp)が同一タスクの数値を上回りました。これはガイドラインが1トレースの詳細を記憶するのではなく、再利用可能な失敗パターンを捉えていることを示しています。
エージェントを本番出荷する際のチェックリスト
- Mean@kの隣にPass^kを報告する。 平均値は信頼性の高いエージェントと運の良いエージェントを区別できない。k=3でも知らなかったギャップが浮かび上がる
- 難易度が上がるほどギャップが広がることを想定する。 最も難しい階層こそ、平均値1つが最も誤解を招く
- まず大きなモデルに飛びつかない。 一貫性は能力と直交する。強いモデルはMean@kを上げるが、一貫性ギャップを必ずしも縮小しない
- 診断にグラウンドトゥルースも再実行も不要。 判断ステップごとにk=5補完をサンプリングする追加LLM呼び出し1回で十分。タスクのエンドツーエンド再実行ができない本番トラフィックでも利用できる
試してみる
ALTK-Evolveツールキット(オープンソースリポジトリ: github.com/AgentToolkit/altk-evolve)にConsistency Analyzerと一貫性ガイドライン生成が追加されています。完全な方法論と評価はarXivの技術レポートで公開されています。
付録:メトリクスの定義
| 指標 | 定義 |
|---|---|
| Mean@k | タスクをk回実行し、平均合格率を報告。ほとんどのベンチマークが「精度」と呼ぶもの |
| Pass^k | k回の独立実行すべてでエージェントが成功するタスクの割合。常に≤ Mean@k。ユーザーが同じクエリを2回実行したときの体験 |
| Pass@k | k回のうち少なくとも1回成功。楽観的な対応物で、コード生成論文などで一般的 |
| 一貫性ギャップ | Mean@k − Pass^k(パーセントポイント単位) |