# mu-bench testet die Transkription von Sprache in fünf Sprachen

> Forschende haben einen Benchmark entwickelt, der auf Anrufen bei einem KI-Banking-Agenten basiert. Er misst, ob Transkripte die Bedeutung der Anrufenden wiedergeben – und nicht nur, ob die Wörter exakt übereinstimmen.

Oossa · 2026-09-29 · https://oossa.com/de/mu-bench-tests-speech-transcription-in-five-languages

Ein neuer Benchmark namens mu-bench bewertet, wie gut Spracherkennungssysteme Anrufende transkribieren, wenn diese Angaben wie Namen, E-Mail-Adressen und Bestätigungscodes machen. Die 4.270 Äußerungen stammen aus 250 Anrufen bei einem KI-Banking-Agenten auf Englisch, Spanisch, Türkisch, Vietnamesisch und Mandarin.

Die Forschenden schlagen außerdem die Utterance Error Rate vor. Dabei beurteilt eine KI, ob ein Transkript die Bedeutung bewahrt. Bei Transkripten, die von Menschen bewertet wurden, stimmte diese Kennzahl stärker mit den menschlichen Einschätzungen überein als die Wortfehlerrate, die exakte Übereinstimmungen misst. In Tests mit sechs kommerziellen Anbietern erzielte der beste Anbieter bei der Utterance Error Rate einen Wert von 11,9 Prozent; Mandarin war für alle sechs die schwierigste Sprache.

## Die Fakten

- Der Datensatz umfasst 4.270 Äußerungen aus 250 Anrufen in fünf Sprachen.
- Die Utterance Error Rate stimmte mit den Bewertungen menschlicher Prüfender mit κ = 0,78 überein, verglichen mit 0,53 bei der Wortfehlerrate auf normalisiertem Text, die exakte Übereinstimmungen misst.

## Warum es wichtig ist

Zu prüfen, ob ein Transkript die Bedeutung der Anrufenden bewahrt, kann besser zeigen, ob ein Sprachagent wichtige Angaben korrekt verarbeiten kann, als lediglich Wortabweichungen zu zählen.

## Quellen und Referenzen

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Zuletzt aktualisiert: 2026-09-29
