# mu-bench test spraakherkenning in vijf talen

> Onderzoekers hebben een benchmark ontwikkeld op basis van gesprekken met een AI-bankier. Die meet of transcripties de betekenis van bellers behouden, niet alleen of hun woorden exact overeenkomen.

Oossa · 2026-09-29 · https://oossa.com/nl/mu-bench-tests-speech-transcription-in-five-languages

Een nieuwe benchmark, mu-bench, beoordeelt hoe goed spraakherkenningssystemen gesprekken transcriberen waarin bellers gegevens doorgeven, zoals namen, e-mailadressen en bevestigingscodes. De benchmark bevat 4.270 uitingen uit 250 gesprekken met een AI-bankier, in het Engels, Spaans, Turks, Vietnamees en Mandarijn.

De onderzoekers stellen ook Utterance Error Rate voor. Die maatstaf gebruikt een AI-beoordelaar om vast te stellen of een transcript de betekenis behoudt. Bij transcripties die door mensen werden beoordeeld, kwam de maatstaf sterker overeen met hun oordeel dan de woordfoutscore op basis van exacte overeenkomsten. In tests met zes commerciële aanbieders scoorde de beste 11,9% op Utterance Error Rate; voor alle zes was Mandarijn de lastigste taal.

## De feiten

- De dataset bevat 4.270 uitingen uit 250 gesprekken, in vijf talen.
- Utterance Error Rate kwam overeen met de beoordelingen van menselijke beoordelaars met κ = 0,78, tegenover 0,53 voor de woordfoutscore op basis van exacte overeenkomsten bij genormaliseerde tekst.

## Waarom het ertoe doet

Testen of een transcript de betekenis van de beller behoudt, laat mogelijk beter zien of een spraakagent belangrijke gegevens correct kan verwerken dan het tellen van afwijkende woorden.

## Bronnen en referenties

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Laatst bijgewerkt: 2026-09-29
