# mu-bench testa a transcrição de fala em cinco idiomas

> Pesquisadores apresentaram um benchmark baseado em chamadas para um agente bancário de IA. Ele avalia se as transcrições preservam o sentido do que os clientes dizem, e não apenas se reproduzem exatamente as palavras.

Oossa · 2026-09-29 · https://oossa.com/pt/mu-bench-tests-speech-transcription-in-five-languages

Um novo benchmark chamado mu-bench avalia a precisão com que sistemas de reconhecimento de fala transcrevem clientes informando dados como nomes, endereços de e-mail e códigos de confirmação. Suas 4.270 falas vêm de 250 chamadas para um agente bancário de IA em inglês, espanhol, turco, vietnamita e mandarim.

Os pesquisadores também propõem a Utterance Error Rate, que usa um avaliador de IA para verificar se uma transcrição preserva o sentido. Nas transcrições avaliadas por pessoas, essa métrica concordou mais com os julgamentos humanos do que a taxa de erro de palavras baseada em correspondência exata. Em testes com seis fornecedores comerciais, o melhor resultado foi de 11,9% na Utterance Error Rate; o mandarim foi o idioma mais difícil para todos os seis.

## Os fatos

- O conjunto de dados contém 4.270 falas de 250 chamadas, em cinco idiomas.
- A Utterance Error Rate concordou com os avaliadores humanos com κ = 0,78, contra 0,53 para a taxa de erro de palavras baseada em correspondência exata em texto normalizado.

## Por que importa

Verificar se uma transcrição preserva o sentido do que o cliente diz pode mostrar melhor se um agente de voz consegue lidar corretamente com informações importantes do que simplesmente contar palavras divergentes.

## Fontes e referências

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Última atualização: 2026-09-29
