Kısa haber · 1 dk okuma
mu-bench konuşma dökümlerini beş dilde test ediyor
Araştırmacılar, bir yapay zekâ bankacılık temsilcisiyle yapılan görüşmelere dayanan bir kıyaslama testi geliştirdi. Test, dökümlerin arayanların söylediklerini birebir yansıtıp yansıtmadığını değil, anlamı koruyup korumadığını ölçüyor.
Oossa · Oossa Hakkında
mu-bench adlı yeni bir kıyaslama testi, konuşma tanıma sistemlerinin arayanların ad, e-posta adresi ve onay kodu gibi bilgileri verirken söylediklerini ne kadar iyi yazıya döktüğünü değerlendiriyor. Veri kümesindeki 4.270 ifade, İngilizce, İspanyolca, Türkçe, Vietnamca ve Mandarin dillerinde bir yapay zekâ bankacılık temsilcisiyle yapılan 250 görüşmeden alındı.
Araştırmacılar ayrıca, bir yapay zekâ değerlendiricisinin dökümün anlamı koruyup korumadığını ölçtüğü Utterance Error Rate’i öneriyor. İnsanlar tarafından değerlendirilen dökümlerde bu ölçüt, birebir eşleşmeye dayalı kelime hata oranına kıyasla insan değerlendirmeleriyle daha fazla örtüştü. Altı ticari sağlayıcının test edildiği değerlendirmede en iyi sonuç Utterance Error Rate’te %11,9 oldu; Mandarin, altı sağlayıcının tümü için en zor dildi.
Neden önemli
Bir dökümün arayanın anlamını koruyup korumadığını test etmek, bir sesli temsilcinin önemli ayrıntıları doğru şekilde ele alıp alamadığını, kelime uyuşmazlıklarını saymaktan daha iyi gösterebilir.
Kaynaklar ve referanslar
| # | Kaynak | Yayın | Tarih | Ana fikir |
|---|---|---|---|---|
| 1 | mu-bench: A Multilingual Utterance Transcription Benchmark ↗ | arXiv | 29 Eyl 2026 | arXiv:2609.32082v1 Announce Type: new Abstract: Voice agents depend on accurate automatic speech recognition (ASR) to act on what callers sa |
1 kaynak
Son güncelleme:
Oossa · Bülten
Yapay zekâda hafta, anlaşılır dille
Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.