# mu-bench पांच भाषाओं में वाक्-प्रतिलेखन की जांच करता है

> शोधकर्ताओं ने AI बैंकिंग एजेंट को किए गए कॉल पर आधारित एक बेंचमार्क पेश किया है। यह मापता है कि प्रतिलेख में कॉल करने वाले का आशय बरकरार है या नहीं—सिर्फ यह नहीं कि शब्द हूबहू मेल खाते हैं या नहीं।

Oossa · 2026-09-29 · https://oossa.com/hi/mu-bench-tests-speech-transcription-in-five-languages

mu-bench नाम का नया बेंचमार्क यह परखता है कि वाक्-पहचान प्रणालियां नाम, ईमेल पते और पुष्टि कोड जैसी जानकारी देने वाले कॉल करने वालों की बातों को कितनी अच्छी तरह लिखित रूप में दर्ज करती हैं। इसमें अंग्रेज़ी, स्पैनिश, तुर्की, वियतनामी और मंदारिन में AI बैंकिंग एजेंट को किए गए 250 कॉल से लिए गए 4,270 कथन शामिल हैं।

शोधकर्ताओं ने Utterance Error Rate भी प्रस्तावित किया है। इसमें AI निर्णायक यह आकलन करता है कि प्रतिलेख में मूल अर्थ सुरक्षित है या नहीं। लोगों द्वारा आंके गए प्रतिलेखों में, यह माप सटीक शब्द-मिलान वाले Word Error Rate की तुलना में मानवीय फैसलों से अधिक मेल खाता था। छह व्यावसायिक सेवा प्रदाताओं के परीक्षण में सबसे अच्छा स्कोर 11.9% रहा; छहों के लिए मंदारिन सबसे कठिन भाषा थी।

## तथ्य

- इस डेटासेट में पांच भाषाओं के 250 कॉल से लिए गए 4,270 कथन हैं।
- Utterance Error Rate का मानवीय मूल्यांकनकर्ताओं से κ = 0.78 का मेल रहा, जबकि सामान्यीकृत पाठ पर सटीक शब्द-मिलान वाले Word Error Rate के लिए यह 0.53 था।

## यह क्यों मायने रखता है

यह जांचना कि प्रतिलेख में कॉल करने वाले का आशय बरकरार है या नहीं, शब्दों के अंतर गिनने की तुलना में बेहतर ढंग से दिखा सकता है कि कोई वॉइस एजेंट जरूरी जानकारी को सही तरीके से संभाल पाएगा या नहीं।

## स्रोत और संदर्भ

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

अंतिम अपडेट: 2026-09-29
