英国AIセキュリティ研究所(AISI)は、EvalEvalのインフラストラクチャを活用し、AIモデルの評価結果をオープンに共有することで、より再現性が高く検証可能な評価科学の推進を支援しています。
AIの導入が加速する中で、モデルやシステムの性能に関する評価は重要な証拠源となっていますが、結果が様々な形式やプラットフォームで報告されるため、再現に必要な情報が不足しているケースが多く見られます。
この取り組みは、評価結果とそれを解釈するために必要な情報を共通の構造にまとめる共有報告スキーマ「Every Eval Ever (EEE)」とオープンプラットフォーム「Evaluation Cards」を提供するEvalEvalのミッションに基づいています。
AISIは、OptStopやHiBayESといった独自の取り組みで評価の効率化や統計的厳密性を高めてきた実績があり、EvalEvalとの連携により、評価報告におけるギャップを診断し、それを埋めるための共有インフラ構築を進めています。
今回の共同フェーズでは、AISIが適切な評価手法と知見をEvaluation Cardsを通じて公開しています。
具体的には、主要な実験で用いられた5つのベンチマークについて、検証済みの結果、文脈情報、および設定情報が公開されました。
この公開には、Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2、GPT-5.4といった6つの最先端モデルのデータが含まれています。
また、異なる部分的に重複するモデル群を用いた2つの関連するサイバー評価(Cyber CTFsとThe Last Ones)の結果も含まれています。
これらのデータは、AISIの論文「How Inference Compute Shapes Frontier LLM Evaluation」に付随しており、この論文では、ベンチマークの性能が推論時の計算量や評価プロトコルにどのように依存するかを研究しています。
特に「Humanity's Last Exam」における性能は、評価プロトコルや推論計算量によって変化することが示されています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。
Hugging Face
How UK AISI and EvalEval Are Making Benchmark Results Reproducible
原文の記事を確認する ↗