# 5개 언어 음성 전사를 평가하는 mu-bench

> 연구진이 AI 은행 상담원과의 통화를 바탕으로 한 벤치마크를 공개했다. 단어가 정확히 일치하는지뿐 아니라 전사문이 발신자의 뜻을 보존하는지도 측정한다.

Oossa · 2026-09-29 · https://oossa.com/ko/mu-bench-tests-speech-transcription-in-five-languages

mu-bench라는 새 벤치마크는 이름, 이메일 주소, 확인 코드 같은 정보를 말하는 발신자의 음성을 음성 인식 시스템이 얼마나 잘 전사하는지 평가한다. 데이터는 AI 은행 상담원과 영어, 스페인어, 터키어, 베트남어, 만다린어로 진행한 통화 250건에서 수집한 발화 4,270개로 구성됐다.

연구진은 AI 심판이 전사문이 의미를 보존했는지 평가하는 ‘발화 오류율(Utterance Error Rate)’도 제안했다. 사람이 평가한 전사문을 대상으로 한 결과, 이 지표는 정확히 일치하는지를 따지는 단어 오류율보다 사람의 판단과 더 높은 일치도를 보였다. 상용 서비스 제공업체 6곳을 시험한 결과, 가장 우수한 업체의 발화 오류율은 11.9%였으며 만다린어는 6곳 모두에 가장 어려운 언어였다.

## 팩트

- 데이터셋에는 5개 언어로 진행한 통화 250건에서 수집한 발화 4,270개가 포함됐다.
- 정규화된 텍스트에서 발화 오류율은 인간 평가자와 κ = 0.78의 일치도를 보였다. 정확히 일치하는지를 따지는 단어 오류율의 일치도는 0.53이었다.

## 왜 중요한가

전사문이 발신자의 뜻을 보존하는지 평가하면 단어 불일치 개수를 세는 것보다 음성 에이전트가 중요한 정보를 제대로 처리할 수 있는지 더 잘 보여줄 수 있다.

## 출처 및 참고 자료

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

최종 업데이트: 2026-09-29
