# آزمون mu-bench دقت رونویسی گفتار را در پنج زبان می‌سنجد

> پژوهشگران معیارسنجی‌ای معرفی کرده‌اند که بر پایه تماس‌ها با یک عامل بانکی هوش مصنوعی ساخته شده است. این معیار می‌سنجد که آیا متن پیاده‌شده معنای گفته‌های تماس‌گیرندگان را حفظ می‌کند یا نه؛ نه اینکه فقط واژه‌هایشان دقیقاً با هم مطابقت داشته باشد.

Oossa · 2026-09-29 · https://oossa.com/fa/mu-bench-tests-speech-transcription-in-five-languages

معیارسنجی تازه‌ای به نام mu-bench ارزیابی می‌کند که سامانه‌های تشخیص گفتار تا چه اندازه گفته‌های تماس‌گیرندگان را، هنگام بیان اطلاعاتی مانند نام، نشانی ایمیل و کد تأیید، درست پیاده می‌کنند. این مجموعه شامل 4,270 گفته از 250 تماس با یک عامل بانکی هوش مصنوعی به زبان‌های انگلیسی، اسپانیایی، ترکی، ویتنامی و چینی ماندارین است.

پژوهشگران همچنین معیار «نرخ خطای گفته» را پیشنهاد کرده‌اند که با کمک یک داور هوش مصنوعی می‌سنجد آیا متن پیاده‌شده معنا را حفظ می‌کند یا نه. در متن‌هایی که افراد ارزیابی کرده بودند، این معیار بیش از نرخ خطای واژه‌ایِ مبتنی بر تطبیق دقیق با قضاوت انسان‌ها همخوانی داشت. در آزمایش شش ارائه‌دهنده تجاری، بهترین امتیاز نرخ خطای گفته 11.9% بود؛ ماندارین برای هر شش ارائه‌دهنده دشوارترین زبان بود.

## حقایق

- این مجموعه داده شامل 4,270 گفته از 250 تماس به پنج زبان است.
- همخوانی نرخ خطای گفته با ارزیابان انسانی κ = 0.78 بود، در مقایسه با 0.53 برای نرخ خطای واژه‌ایِ مبتنی بر تطبیق دقیق در متن نرمال‌شده. 

## چرا مهم است

آزمودن اینکه آیا متن پیاده‌شده معنای گفته‌های تماس‌گیرنده را حفظ می‌کند یا نه، ممکن است بهتر از شمردن اختلاف واژه‌ها نشان دهد که یک عامل صوتی می‌تواند اطلاعات مهم را درست پردازش کند یا نه.

## منابع و ارجاع‌ها

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

آخرین به‌روزرسانی: 2026-09-29
