خبر کوتاه · 1 دقیقه مطالعه
آزمون mu-bench دقت رونویسی گفتار را در پنج زبان میسنجد
پژوهشگران معیارسنجیای معرفی کردهاند که بر پایه تماسها با یک عامل بانکی هوش مصنوعی ساخته شده است. این معیار میسنجد که آیا متن پیادهشده معنای گفتههای تماسگیرندگان را حفظ میکند یا نه؛ نه اینکه فقط واژههایشان دقیقاً با هم مطابقت داشته باشد.
Oossa · درباره Oossa
معیارسنجی تازهای به نام mu-bench ارزیابی میکند که سامانههای تشخیص گفتار تا چه اندازه گفتههای تماسگیرندگان را، هنگام بیان اطلاعاتی مانند نام، نشانی ایمیل و کد تأیید، درست پیاده میکنند. این مجموعه شامل 4,270 گفته از 250 تماس با یک عامل بانکی هوش مصنوعی به زبانهای انگلیسی، اسپانیایی، ترکی، ویتنامی و چینی ماندارین است.
پژوهشگران همچنین معیار «نرخ خطای گفته» را پیشنهاد کردهاند که با کمک یک داور هوش مصنوعی میسنجد آیا متن پیادهشده معنا را حفظ میکند یا نه. در متنهایی که افراد ارزیابی کرده بودند، این معیار بیش از نرخ خطای واژهایِ مبتنی بر تطبیق دقیق با قضاوت انسانها همخوانی داشت. در آزمایش شش ارائهدهنده تجاری، بهترین امتیاز نرخ خطای گفته 11.9% بود؛ ماندارین برای هر شش ارائهدهنده دشوارترین زبان بود.
چرا مهم است
آزمودن اینکه آیا متن پیادهشده معنای گفتههای تماسگیرنده را حفظ میکند یا نه، ممکن است بهتر از شمردن اختلاف واژهها نشان دهد که یک عامل صوتی میتواند اطلاعات مهم را درست پردازش کند یا نه.
منابع و ارجاعها
| # | منبع | رسانه | تاریخ | نکته اصلی |
|---|---|---|---|---|
| 1 | mu-bench: A Multilingual Utterance Transcription Benchmark ↗ | arXiv | ۷ مهر ۱۴۰۵ | arXiv:2609.32082v1 Announce Type: new Abstract: Voice agents depend on accurate automatic speech recognition (ASR) to act on what callers sa |
1 منبع
آخرین بهروزرسانی:
Oossa · خبرنامه
هفتهٔ هوش مصنوعی، به زبان ساده
هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.