# mu-bench проверяет точность распознавания речи на пяти языках

> Исследователи представили бенчмарк на основе звонков ИИ-агенту банковской службы. Он оценивает, сохраняют ли расшифровки смысл сказанного, а не только совпадают ли дословно с произнесёнными словами.

Oossa · 2026-09-29 · https://oossa.com/ru/mu-bench-tests-speech-transcription-in-five-languages

Новый бенчмарк под названием mu-bench оценивает, насколько хорошо системы распознавания речи расшифровывают звонки, в которых люди сообщают такие данные, как имена, адреса электронной почты и коды подтверждения. В него вошли 4 270 высказываний из 250 звонков ИИ-агенту банка на английском, испанском, турецком, вьетнамском и китайском языках (мандаринский вариант).

Исследователи также предложили показатель Utterance Error Rate, при расчёте которого ИИ-оценщик определяет, сохранился ли смысл в расшифровке. На расшифровках, оценённых людьми, этот показатель лучше совпадал с их суждениями, чем показатель доли ошибок в словах, основанный на точном совпадении. В тестах шести коммерческих сервисов лучший результат по Utterance Error Rate составил 11,9%; для всех шести самым сложным оказался китайский язык.

## Факты

- Набор данных включает 4 270 высказываний из 250 звонков на пяти языках.
- Показатель Utterance Error Rate совпадал с оценками людей на уровне κ = 0,78, тогда как для показателя доли ошибок в словах, основанного на точном совпадении и нормализованном тексте, этот показатель составил 0,53.

## Почему это важно

Проверка того, сохраняет ли расшифровка смысл сказанного, может лучше показать, способен ли голосовой агент правильно обрабатывать важные данные, чем простой подсчёт несовпадающих слов.

## Источники и ссылки

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Обновлено: 2026-09-29
