# mu-bench évalue la transcription vocale dans cinq langues

> Des chercheurs ont présenté un benchmark fondé sur des appels à un agent bancaire doté d’IA. Il mesure si les transcriptions préservent le sens des propos des appelants, et pas seulement si les mots correspondent exactement.

Oossa · 2026-09-29 · https://oossa.com/fr/mu-bench-tests-speech-transcription-in-five-languages

Un nouveau benchmark, baptisé mu-bench, évalue la capacité des systèmes de reconnaissance vocale à transcrire les informations fournies par les appelants, comme des noms, des adresses e-mail et des codes de confirmation. Il rassemble 4 270 énoncés tirés de 250 appels à un agent bancaire doté d’IA, en anglais, en espagnol, en turc, en vietnamien et en mandarin.

Les chercheurs proposent également l’Utterance Error Rate, une mesure qui s’appuie sur un juge IA pour déterminer si une transcription préserve le sens. Pour les transcriptions évaluées par des personnes, cette mesure correspondait davantage aux jugements humains que le taux d’erreur sur les mots fondé sur une correspondance exacte. Lors de tests menés auprès de six fournisseurs commerciaux, le meilleur a obtenu un score de 11,9 % à l’Utterance Error Rate ; le mandarin était la langue la plus difficile pour les six.

## Les faits

- Le jeu de données comprend 4 270 énoncés tirés de 250 appels, dans cinq langues.
- L’Utterance Error Rate correspondait aux évaluations humaines avec un κ = 0,78, contre 0,53 pour le taux d’erreur sur les mots fondé sur une correspondance exacte, sur un texte normalisé.

## Pourquoi c'est important

Évaluer si une transcription préserve le sens des propos de l’appelant pourrait mieux indiquer si un agent vocal est capable de traiter correctement des informations importantes que le simple décompte des mots mal transcrits.

## Sources et références

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Dernière mise à jour: 2026-09-29
