# mu-bench testar taltranskribering på fem språk

> Forskare har introducerat ett riktmärke baserat på samtal med en AI-banktjänst. Det mäter om transkriptioner bevarar vad den som ringer menar, inte bara om orden stämmer exakt.

Oossa · 2026-09-29 · https://oossa.com/sv/mu-bench-tests-speech-transcription-in-five-languages

Ett nytt riktmärke kallat mu-bench utvärderar hur väl taligenkänningssystem transkriberar när personer som ringer uppger uppgifter som namn, e-postadresser och bekräftelsekoder. De 4 270 yttrandena kommer från 250 samtal med en AI-banktjänst på engelska, spanska, turkiska, vietnamesiska och mandarin.

Forskarna föreslår också Utterance Error Rate, som använder en AI-bedömare för att avgöra om en transkription bevarar innebörden. För transkriptioner som bedömts av människor stämde måttet bättre överens med de mänskliga bedömningarna än det exakta ord-för-ord-måttet Word Error Rate. I tester av sex kommersiella leverantörer fick den bästa 11,9 procent enligt Utterance Error Rate; mandarin var det svåraste språket för alla sex.

## Fakta

- Datamängden innehåller 4 270 yttranden från 250 samtal på fem språk.
- Utterance Error Rate stämde överens med mänskliga bedömare på κ = 0,78, jämfört med 0,53 för exakt ord-för-ord-mätning av Word Error Rate på normaliserad text.

## Varför det spelar roll

Att testa om en transkription bevarar vad den som ringer menar kan ge en bättre bild av om en röstbaserad AI-tjänst kan hantera viktiga uppgifter korrekt än att bara räkna ord som inte stämmer.

## Källor och referenser

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Senast uppdaterad: 2026-09-29
