# mu-bench يختبر تفريغ الكلام إلى نص بخمس لغات

> قدّم باحثون معيارًا يستند إلى مكالمات مع وكيل مصرفي يعمل بالذكاء الاصطناعي. ويقيس المعيار ما إذا كانت النصوص المكتوبة تحافظ على معنى المتصلين، لا مجرد تطابق كلماتهم حرفيًا.

Oossa · 2026-09-29 · https://oossa.com/ar/mu-bench-tests-speech-transcription-in-five-languages

يقيّم معيار جديد يُسمى mu-bench مدى دقة أنظمة التعرّف على الكلام في تفريغ مكالمات يقدّم فيها المتصلون معلومات مثل الأسماء وعناوين البريد الإلكتروني ورموز التأكيد. وتتألف بياناته من 4,270 مقطعًا صوتيًا مأخوذًا من 250 مكالمة مع وكيل مصرفي يعمل بالذكاء الاصطناعي، بالإنجليزية والإسبانية والتركية والفيتنامية والماندرين.

ويقترح الباحثون أيضًا مقياس «معدل أخطاء العبارات»، الذي يستعين بحَكَم يعمل بالذكاء الاصطناعي لتقييم مدى حفاظ النص المكتوب على المعنى. وفي النصوص التي قيّمها أشخاص، توافق هذا المقياس مع أحكام البشر بدرجة أكبر من مقياس معدل أخطاء الكلمات القائم على التطابق الحرفي. وفي اختبارات شملت ستة مزوّدين تجاريين، سجّل أفضلهم 11.9% على مقياس معدل أخطاء العبارات؛ وكانت الماندرين أصعب اللغات على المزوّدين الستة جميعًا.

## الحقائق

- تضم مجموعة البيانات 4,270 مقطعًا صوتيًا من 250 مكالمة، بخمس لغات.
- بلغ توافق مقياس معدل أخطاء العبارات مع المقيّمين البشر κ = 0.78، مقارنةً بـ0.53 لمقياس معدل أخطاء الكلمات القائم على التطابق الحرفي للنص بعد تطبيعه.

## لماذا يهم

قد يكشف اختبار ما إذا كان النص المكتوب يحافظ على معنى المتصل، بصورة أفضل من مجرد إحصاء الكلمات غير المتطابقة، عن قدرة الوكيل الصوتي على التعامل بدقة مع التفاصيل المهمة.

## المصادر والمراجع

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

آخر تحديث: 2026-09-29
