Kort bericht · 1 min lezen
mu-bench test spraakherkenning in vijf talen
Onderzoekers hebben een benchmark ontwikkeld op basis van gesprekken met een AI-bankier. Die meet of transcripties de betekenis van bellers behouden, niet alleen of hun woorden exact overeenkomen.
Oossa · Over Oossa
Een nieuwe benchmark, mu-bench, beoordeelt hoe goed spraakherkenningssystemen gesprekken transcriberen waarin bellers gegevens doorgeven, zoals namen, e-mailadressen en bevestigingscodes. De benchmark bevat 4.270 uitingen uit 250 gesprekken met een AI-bankier, in het Engels, Spaans, Turks, Vietnamees en Mandarijn.
De onderzoekers stellen ook Utterance Error Rate voor. Die maatstaf gebruikt een AI-beoordelaar om vast te stellen of een transcript de betekenis behoudt. Bij transcripties die door mensen werden beoordeeld, kwam de maatstaf sterker overeen met hun oordeel dan de woordfoutscore op basis van exacte overeenkomsten. In tests met zes commerciële aanbieders scoorde de beste 11,9% op Utterance Error Rate; voor alle zes was Mandarijn de lastigste taal.
Waarom het ertoe doet
Testen of een transcript de betekenis van de beller behoudt, laat mogelijk beter zien of een spraakagent belangrijke gegevens correct kan verwerken dan het tellen van afwijkende woorden.
Bronnen en referenties
| # | Bron | Medium | Datum | Kernpunt |
|---|---|---|---|---|
| 1 | mu-bench: A Multilingual Utterance Transcription Benchmark ↗ | arXiv | 29 sep 2026 | arXiv:2609.32082v1 Announce Type: new Abstract: Voice agents depend on accurate automatic speech recognition (ASR) to act on what callers sa |
1 bronnen
Laatst bijgewerkt:
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.