記事のサマリー(TL;DR)
- Hugging FaceとVoice Arenaが、Open ASR Leaderboardに初のグローバルサウス言語(ヒンディー語・インド英語)評価セットを追加
- 4,888名・428地区にわたる多様な話者データと12種のメタデータで、地域・年齢・デバイス別のWER格差を定量化可能に
- ヒンディー語は表記揺れ問題に対応するため、従来のWERに代わり「OIWER(Orthographically-Informed Word Error Rate)」を採用
音声認識モデルの評価に取り組む日本語ASR開発者・SaaS事業者への示唆
英語・ヨーロッパ語中心のASRベンチマークが抱える「特定話者・地域への偏り」の問題は、日本語音声認識にも共通する構図だ。今回のMonsoonが示した設計思想——地域・年齢・デバイスをメタデータとして厳密に記録し、集計WERではなく属性別誤認率で評価する——は、方言・年代・録音環境が多様な日本語音声データの品質評価にも直接応用できる。kintoneやSalesforceの現場業務に音声入力UIを組み合わせるケースでは、特定端末や環境への過学習を防ぐうえで、こうした多軸評価の枠組みが参照値になる。また、ヒンディー語の表記揺れに対応した「ラティス(lattice)型正解定義+OIWER」は、日本語の漢字・かな・英字混在や固有名詞表記ゆれへの対処として応用を検討する価値がある。
詳細
ベンチマークが「作られるもの」を決める
Open ASR Leaderboardで高スコアを出したモデルは採用・改善が進む一方、測定対象外の能力は改善されにくい。これまでリーダーボードの整備では、以下のような取り組みが行われてきた。
- ホールドアウト済みの非公開テスト分割
- モデルが音声を転写せずに参照テキストを再現していないかを定量化するベンチマーク適合分析
- 正しい予測・表記バリアントがペナルティを受けないよう、正規化処理のギャップを修正
これらは集計WER(Word Error Rate)を操作しにくくするための対策だ。ただし、それでも「単一の数値」に過ぎない。
先行研究では、ASRの誤認率が話者によって不均一に分布することが示されている。”Racial disparities in automated speech recognition”(人種別格差の研究)では、商用システムが黒人話者に対して白人話者の約2倍の誤認率を示すことが確認されており、年齢・性別・アクセントによる差も報告されている。こうした偏りは現在のリーダーボードには表れない。テストセットに記録されているのは「何が話されたか」であり、「誰が話したか」に関する情報はほとんど存在しないためだ。
新評価セット「Monsoon en-IN」と「Monsoon hi-IN」の概要
この課題に対応するため、Open ASR Leaderboardに2つの評価セットが追加された。
- Monsoon en-IN:インド英語
- Monsoon hi-IN:ヒンディー語
ヒンディー語は5億人以上が話す言語であり、現在ヨーロッパ語のみをカバーしている多言語タブに追加された初のインド系言語だ。各セットは公開分割(自己採点用)と非公開分割(ベンチマーク最適化を抑制するためのホールドアウト)で構成されており、4分割すべてで話者が重複しない設計になっている(計4,888名、各話者に12種の属性を記録)。
データセット設計の思想
テストセットが露出できる失敗モードは、そのセットが変化する軸によって決まる。従来のベンチマークは入手しやすい音声を使って構築されることが多いが、Monsoonは以下の9軸で意図的にバリエーションを設けた。
- 地理(Geography)
- 年齢(Age)
- 性別(Gender)
- 語彙(Vocabulary)
- 録音デバイス(Devices)
- 音響環境(Acoustic environments)
- 発話スタイル(Speech type)
- 発話速度(Speech rate)
- 同一音声に対する複数の正解文(Multiple valid transcripts)
収集方法もこの設計に従い、少数地点での長時間録音ではなく数百の地区から広域にリクルートし、支給機材ではなく話者自身のスマートフォンと通信環境を使用した。
データセット構成
| セット | 言語 | 時間 | 話者数 | M/F | 地区数 | 州/UT数 | デバイス数 | スタイル | 転写形式 |
|---|---|---|---|---|---|---|---|---|---|
| Monsoon en-IN public | インド英語 | 5.62h | 1,444 | 50/50 | 428 | 24/6 | 556 | 会話・自発 | 正規化・非流暢語あり |
| Monsoon en-IN private | インド英語 | 5.58h | 1,405 | 45/55 | 420 | 24/6 | 560 | 会話・自発 | 正規化・非流暢語あり |
| Monsoon hi-IN public | ヒンディー語 | 1.33h | 468 | 54/46 | 202 | 11/3 | 315 | 会話・自発 | ラティス(表記バリアント許容) |
| Monsoon hi-IN private | ヒンディー語 | 4.47h | 1,571 | 55/45 | 295 | 12/3 | 582 | 会話・自発 | ラティス(表記バリアント許容) |
データはスクリプトなし・デュアルチャンネルの自発的会話から収集し、各クリップは1話者1チャンネルで構成される。各クリップには職業・学歴・婚姻状況・収入帯・端末ブランド・現在の都市・現住地区在住年数も付与されている。
公開インド英語分割のサンプル例(メタデータ含む):
- 29歳女性、西トリプラ州、トリプラ。学生、samsung SM-G781B使用
- 32歳女性、サトナ、マディヤ・プラデーシュ州。無職、samsung SM-E146B使用
- 22歳男性、ロータス、ビハール州。学生、motorola moto g54 5G使用
- 27歳女性、ワランガル、テランガーナ州。無職、vivo V2247使用
- 57歳男性、プドゥチェリー。民間勤務、Xiaomi M2006C3LI使用
英語セットは標準的な文字列参照形式を採用し、正規化処理でほとんどのスペルバリアントを統一する。ヒンディー語は正規化だけでは対応できない大量の表記揺れがあるため、各テキストスパンに対して正解として認められる表記リストを持つ「ラティス形式」を採用した。
話者カバレッジの特徴
Monsoonは時間ベースでは小規模だが、話者ベースでは大規模だ。この設計が主要な価値を生んでいる。
| 指標 | hi-IN public | hi-IN private | en-IN public | en-IN private |
|---|---|---|---|---|
| 話者あたり平均セグメント数 | 1.61 | 1.56 | 1.46 | 1.48 |
| 1セグメントのみの話者数 | 261 | 994 | 956 | 924 |
| 話者あたりの音声(中央値) | 8.34s | 8.28s | 12.36s | 12.39s |
| 上位10名のシェア | 6.8% | 3.1% | 2.8% | 2.9% |
| 現居住都市数 | 289 | 814 | 641 | 584 |
| デバイスメーカー数 | 18 | 25 | 23 | 20 |
三つの重要な特性がある。
- 特定話者がスコアを左右しない:上位10名の総収録時間シェアは2.8〜6.8%に過ぎず、話者の半数以上は1セグメントのみ登場。スコアは数百の異なる声の平均値になる。
- 特定地域・端末がスコアを左右しない:インド英語の公開セットは30州・連邦直轄領にわたる428地区をカバー。録音デバイスは315〜582機種、1機種の最大シェアはどのサブセットでも2.1%以内。
- インド英語は一つのアクセントではない:全6地域区が代表されており、公開セットでは南部35%、東部18%、中央18%、北部16%、西部11%のセグメントが含まれる。
メタデータフィールド
Monsoonは1セグメントあたり18カラムを提供し、うち12が話者メタデータだ。多くの公開ASRテストセットが識別子・転写・時間のみを記録するのとは対照的である。
| グループ | フィールド |
|---|---|
| セグメント | id, audio, audio_length_s, language |
| 参照 | ラティス(ヒンディー)またはテキスト(インド英語) |
| 話者 | speaker_id, gender, date_of_birth |
| 背景 | occupation, educational_background, marital_status, income |
| 地理 | native_district, native_state, current_city, years_spent_in_current_district |
| 録音 | device_manufacturer, device_model |
インドの州境は言語的な境界に沿って引かれているため、地区・州は実際のアクセント情報を持つ。先行研究では閉鎖型ベンチマークで地区レベルの誤認率が4〜44%にわたることが報告されており、Monsoonはこれと同様の分析を公開リーダーボードで実現する。
収集・品質管理プロセス
リクルートと録音:Voice Arenaコミュニティを通じて、音声コーパスがほとんどカバーしていない地方・準都市部まで広域でリクルート。ペアによるデュアルチャンネルの会話を、各自のスマートフォンと通信環境を使用して記録。低スペック端末・不安定な通信環境もフィルタリングせずそのままリリース音声に含めている。参加者は言語能力スクリーニングを受け、報酬と同意書に基づいて参加した。
発話の誘導:構造化されていないガイドとオープンエンドの質問でナラティブを引き出し、旅行・医療・農業・教育・デジタルサービスなどのドメインにわたる自発的な会話を収集。候補トピックはLLMで生成後、ネイティブ言語学者がレビュー・現地化した。
品質管理:転写前に各録音が複数のゲーティングチェックを通過する。言語識別モデルによる言語確認、性別分類器による自己申告との照合、再生音声の検出モデル、SNR推定による判読不能音源の除去(環境ノイズは保持)、VAD(音声活動検出)によるセグメント化(2秒以上の無音または15秒ソフトキャップ)、DNSMOS P.808チェックなど。
転写:参照転写はすべて人手で行われた。まず社内のASRモデルで初稿を生成(このモデルはどの公開リーダーボードにも掲載されていない)し、その後ネイティブ言語学者が5段階プロトコルで修正・検証を繰り返した。各修正ラウンドの後に別の言語学者による独立した検証ラウンドを実施し、自己監査を排除した。数字は話された通りに単語で書く形式を採用。
地域別評価の実例
公開インド英語分割での分析例として、リーダーボード上で4.81〜4.99 WERに集中する8モデルを対象に地域別集計を行った結果は示唆的だ。
- openai/whisper-large-v3-turbo:地域間の WER 差は0.46ポイント
- mistralai/Voxtral-Mini-3B-2507:コーパス全体では whisper-large-v3-turbo より0.14ポイント差だが、地域間差は1.68ポイント(Central zone 4.38 対 East zone 6.06)
リーダーボード上では区別がつかない2システムが、話者の出身地によって誤認率で最大4倍近い差を示した。さらに「最も難しい地域」もモデルごとに異なる——ibm-granite/granite-speech-3.3-2bは北部が最低スコア、microsoft/VibeVoice-ASR-HFは南部、mistralai/Voxtral-Mini-3B-2507は東部となり、音声の難易度よりモデルの特性を反映している可能性が高い。
ヒンディー語の表記揺れとOIWER
英語の表記揺れは有界だが、ヒンディー語はそうではない。日常会話はコード混在が多く、英語由来の単語のデーヴァナーガリー表記に定説はなく、複合語の分かち書きも任意だ。一つのフレーズに10以上の有効な表記が存在しうるため、単一の正解文を使ったWERでは「言語学者がたまたま選んだ表記に近いかどうか」を測ることになる。
そこで各テキストスパンに正解として認められる表記セットを持つ「ラティス」形式を採用し、AI4Bharatが提案した OIWER(Orthographically-Informed Word Error Rate) を報告する。ラティスを単一の文字列参照に変換してスコアリングした場合と比較すると、すべてのシステムで誤認率が上昇し、かつ上昇幅が均一でないためランキングが変動する。これは単一参照のもとでは、実際の音声認識精度ではなく転写者の表記選択を再現したモデルが有利になることを示している。
実装はvoi-oiwerとしてオープンソース公開されており、全結果を再現可能だ。
リーダーボードへの登録方法
非公開分割の評価を受けるには、Open ASR LeaderboardにモデルをGitHub経由でプルリクエストとして登録する。
- インド英語:メインリーダーボードの「Voice Arena Monsoon」列として追加。デフォルト列に含まれるため、全モデルのAverage WERに寄与する。非公開分割はAppenおよびDataoceanAIのデータと統合したPrivate(conversational)列に反映される。
- ヒンディー語:多言語タブに追加。選択言語すべてに対応したモデルのみがランク付けされる(「Language dataset breakdown」ドロップダウンから「Hindi」を選択でも確認可能)。
今後の展開
ヒンディー語が持つ課題——複数の書き方が存在する言語、ベンチマークがサンプリングしていない話者——は特殊なケースではなく一般的な問題だ。Monsoonが加えるのは「問題を見えるようにする」手段であり、リーダーボードが既に注視しているテストセット上で、話者と参照文のどちらに起因する差異かを追跡できるようにする仕組みだ。この4つのセットはVoice Arenaのグローバルサウス向けデータセットイニシアティブ「Monsoon」の一部として公開されている。