Hugging FaceとVoice Arenaは提携し、オープンな自動音声認識(ASR)評価の枠組みを拡充しました。
この度、南アジアの言語を対象とした評価セットが導入され、特にヒンディー語とインド英語のベンチマークが追加されました。
これまでのリーダーボードは、主にヨーロッパ言語を対象としており、ヒンディー語は世界中で5億人以上が話す言語であり、今回が多言語タブにおける最初のインド系言語の追加となります。
この取り組みの背景には、既存のASR評価における公平性の問題意識があります。
過去の研究では、人種や性別、年齢、アクセントによってASRの誤り率に偏りがあることが指摘されてきましたが、従来のリーダーボードのテストセットは「誰が話したか」という情報を含まず、これらのバイアスを捉えることができませんでした。
このギャップを埋めるため、Open ASRリーダーボードには「Monsoon en-IN」と「Monsoon hi-IN」という2つの評価セットが導入されました。
これらは一般公開されるパブリックスプリットと、ベンチマーク特有の最適化を防ぐために非公開とされるプライベートスプリットの二種類で提供されます。
各セットは4,888人の話者から構成され、話者ごとに12の属性が記録されています。
特筆すべきは、Monsoonセットの構築方法です。
従来のベンチマークが利用可能な音声に依存していたのに対し、Monsoonは地理、年齢、性別、語彙、使用デバイス、音響環境、発話タイプ、発話速度、および同一音声に対する複数の有効な書き起こしが存在するかどうかという9つの軸に沿って意図的に多様化されています。
これにより、平均的なWER(単語誤り率)が低くても、特定の集団に対しては誤りが生じるという現実を評価することが可能になります。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。
Hugging Face
The Open ASR Leaderboard Adds Its First Global South Language
原文の記事を確認する ↗