本稿では、大規模言語モデル(LLM)のベンチマーク評価を、個々のプロンプト(質問やタスク)レベルで監査するための新しい手法「BenchMIRT」が導入されたことを報告しています。
従来のベンチマークは、安全性や一般的な推論といった特定の能力を測定するように設計されていますが、個々のタスクが必ずしもその単一の目標のみを測定しているわけではありません。
例えば、あるバイアスを問う質問であっても、モデルが情報から推論する能力も同時に試されている場合があります。
また、一つのベンチマーク内でも、有害なプロンプト(安全性に関連)と無害なプロンプト(一般推論に関連)が混在している場合、単一のスコア平均化ではその違いが不明瞭になることがあります。
BenchMIRTは、このようなベンチマーク内部の複数のシグナルを分離し、スコアを実際に何が牽引しているのかを研究者が把握できるように支援します。
この手法は、心理測定学の分野で起源を持つ「項目応答理論(IRT)」を基盤としています。
IRTの基本的な考え方は、全ての質問が回答者の能力について同じ情報量を提供しているわけではないという点です。
BenchMIRTは、このIRTを単一次元から多次元IRT(MIRT)へと拡張した点が特徴です。
これにより、同じ質問に対するパフォーマンスに寄与する複数の潜在的な能力を分離することが可能になります。
具体的には、BenchMIRTはモデルレベルと質問レベルの両方でIRTを適用します。
モデルに対しては、選択されたベンチマーク全体で反映される能力に対するモデルの強さを推定し、各質問に対しては、その質問自体の難易度や、より強いモデルと弱いモデルをどれだけ明確に区別できるかを推定します。
この新しいアプローチにより、研究者はベンチマークのスコアがどの具体的な能力によって駆動されているのかを、より詳細かつ多角的に分析することが可能になります。
関連する技術レポート、データセット、およびコードは、Hugging Faceを通じて公開されています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。