# mu-bench evalúa la transcripción de voz en cinco idiomas

> Un equipo de investigadores presentó un benchmark basado en llamadas a un agente bancario de IA. Mide si las transcripciones conservan el sentido de lo que dicen quienes llaman, no solo si sus palabras coinciden exactamente.

Oossa · 2026-09-29 · https://oossa.com/es/mu-bench-tests-speech-transcription-in-five-languages

Un nuevo benchmark, llamado mu-bench, evalúa la precisión con la que los sistemas de reconocimiento de voz transcriben datos que proporcionan quienes llaman, como nombres, direcciones de correo electrónico y códigos de confirmación. Sus 4.270 enunciados proceden de 250 llamadas a un agente bancario de IA en inglés, español, turco, vietnamita y mandarín.

Los investigadores también proponen Utterance Error Rate, una medida que emplea un evaluador de IA para determinar si una transcripción conserva el sentido. En las transcripciones calificadas por personas, esta medida coincidió más con los juicios humanos que la tasa de error de palabras basada en la coincidencia exacta. En pruebas con seis proveedores comerciales, el mejor resultado fue del 11,9 % en Utterance Error Rate; el mandarín fue el idioma más difícil para los seis.

## Los hechos

- El conjunto de datos contiene 4.270 enunciados de 250 llamadas en cinco idiomas.
- Utterance Error Rate coincidió con las evaluaciones humanas con κ = 0,78, frente a 0,53 para la tasa de error de palabras basada en la coincidencia exacta en texto normalizado.

## Por qué importa

Comprobar si una transcripción conserva el sentido de lo que dice quien llama puede mostrar mejor si un agente de voz es capaz de gestionar correctamente datos importantes que limitarse a contar las palabras que no coinciden.

## Fuentes y referencias

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Última actualización: 2026-09-29
