AIエージェントの性能評価において、多くのベンチマークは単一の平均的な成功率(Mean@k)を報告しますが、これは実運用における「再現性」という重要な課題を覆い隠しています。
例えば、GPT-4.1を用いたReActエージェントがAppWorldテストで平均77.4%の成功率を示しても、5回の試行すべてで成功するのはわずか53.0%のタスクに留まるという、24.4ポイントもの一貫性のギャップが存在します。
このような変動性は、金融取引の照合や契約書の確認といったミッションクリティカルな業務においては致命的となり得ます。
この問題に対処するため、Hugging Faceは、エージェント自身の過去の実行履歴を再利用可能なガイドラインに自動的に変換するシステム「ALTK-Evolve」を基盤に、新たな評価手法「Consistency Guidelines」を導入しました。
この手法は、診断ツールである「Consistency Analyzer」を利用し、エージェントの軌跡を再サンプリングすることで、モデルがわずかなトークン差で異なる決定を下す可能性のある「フリップしやすい決定点」を特定します。
この診断は、タスク全体を再実行することなく、単一のトレースと、k個の補完(デフォルトでk=5)を要求する単一の呼び出しで実行可能です。
この診断結果をガイドラインに変換することで、再現性のギャップを大幅に縮小させることが可能になりました。
具体的には、24.4ポイントあったギャップを12.0ポイントに半減させることが報告されています(同タスクのPass⁵が16.0ポイント向上)。
特筆すべきは、この改善が平均精度を犠牲にすることなく達成された点です。
この発表は、単に「平均的にどれだけ優れているか」を問う従来の評価指標から、「同じ質問を再度投げかけた際に、依然として優れているか」という、実際のユーザーが真に懸念する点に焦点を当てた評価への転換を示しています。
詳細な方法論と評価はarXivの技術レポートで公開されています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。