# mu-bench、5言語で音声文字起こしを評価

> 研究者らは、AI銀行エージェントとの通話をもとにしたベンチマークを発表した。単語が完全に一致するかだけでなく、文字起こしが通話者の意図を保っているかを測定する。

Oossa · 2026-09-29 · https://oossa.com/ja/mu-bench-tests-speech-transcription-in-five-languages

新たなベンチマーク「mu-bench」は、名前やメールアドレス、確認コードなどを伝える通話者の発話を、音声認識システムがどれだけ正確に文字起こしできるかを評価する。対象となるのは、英語、スペイン語、トルコ語、ベトナム語、北京語で行われたAI銀行エージェントとの250件の通話から収集した4,270件の発話だ。

研究者らはまた、AIによる判定を用いて、文字起こしが意味を保っているかを評価する「Utterance Error Rate」を提案した。人間が評価した文字起こしでは、この指標は完全一致を基準とする単語誤り率よりも、人間の判断と高い一致を示した。商用サービス6社を試験したところ、Utterance Error Rateで最も良いスコアは11.9%だった。6社すべてにとって、最も難しい言語は北京語だった。

## 事実

- データセットには、5言語で行われた250件の通話から収集した4,270件の発話が含まれる。
- Utterance Error Rateと人間の評価者との一致度はκ = 0.78で、正規化テキストに対する完全一致ベースの単語誤り率では0.53だった。

## なぜ重要か

文字起こしが通話者の意図を保っているかを確かめることで、単語の不一致を数えるよりも、音声エージェントが重要な情報を正しく扱えるかを把握しやすくなる。

## 出典と参考資料

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

最終更新: 2026-09-29
