# mu-bench 测试五种语言的语音转写表现

> 研究人员推出了一项基于用户致电 AI 银行客服的基准测试，用来衡量转写文本是否保留了来电者的意思，而不只是看字词是否完全匹配。

Oossa · 2026-09-29 · https://oossa.com/zh/mu-bench-tests-speech-transcription-in-five-languages

一项名为 mu-bench 的新基准测试用于评估语音识别系统转写来电者所报信息的表现，例如姓名、电子邮件地址和确认码。数据集包含 4,270 条语音，来自 250 通致电 AI 银行客服的电话，涉及英语、西班牙语、土耳其语、越南语和普通话。

研究人员还提出了“话语错误率”（Utterance Error Rate），借助 AI 评审来判断转写文本是否保留原意。在由人工评估的转写文本中，该指标与人类判断的一致程度高于严格匹配字词的词错误率。在对六家商业服务提供商的测试中，表现最好的一家话语错误率为 11.9%；对六家而言，普通话都是最难处理的语言。

## 事实

- 该数据集包含五种语言的 4,270 条语音，来自 250 通电话。
- 在规范化文本上，话语错误率与人工评分者的一致性为 κ = 0.78，而严格匹配字词的词错误率为 0.53。

## 为什么重要

评估转写文本是否保留来电者的原意，或许比单纯统计字词差异更能体现语音代理能否正确处理重要信息。

## 来源与参考

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

最后更新: 2026-09-29
