# mu-bench konuşma dökümlerini beş dilde test ediyor

> Araştırmacılar, bir yapay zekâ bankacılık temsilcisiyle yapılan görüşmelere dayanan bir kıyaslama testi geliştirdi. Test, dökümlerin arayanların söylediklerini birebir yansıtıp yansıtmadığını değil, anlamı koruyup korumadığını ölçüyor.

Oossa · 2026-09-29 · https://oossa.com/tr/mu-bench-tests-speech-transcription-in-five-languages

mu-bench adlı yeni bir kıyaslama testi, konuşma tanıma sistemlerinin arayanların ad, e-posta adresi ve onay kodu gibi bilgileri verirken söylediklerini ne kadar iyi yazıya döktüğünü değerlendiriyor. Veri kümesindeki 4.270 ifade, İngilizce, İspanyolca, Türkçe, Vietnamca ve Mandarin dillerinde bir yapay zekâ bankacılık temsilcisiyle yapılan 250 görüşmeden alındı.

Araştırmacılar ayrıca, bir yapay zekâ değerlendiricisinin dökümün anlamı koruyup korumadığını ölçtüğü Utterance Error Rate’i öneriyor. İnsanlar tarafından değerlendirilen dökümlerde bu ölçüt, birebir eşleşmeye dayalı kelime hata oranına kıyasla insan değerlendirmeleriyle daha fazla örtüştü. Altı ticari sağlayıcının test edildiği değerlendirmede en iyi sonuç Utterance Error Rate’te %11,9 oldu; Mandarin, altı sağlayıcının tümü için en zor dildi.

## Gerçekler

- Veri kümesi, beş dilde yapılan 250 görüşmeden alınan 4.270 ifade içeriyor.
- Utterance Error Rate, insan değerlendiricilerin sonuçlarıyla κ = 0,78 oranında örtüştü; normalize edilmiş metinde birebir eşleşmeye dayalı kelime hata oranı için bu değer 0,53’tü.

## Neden önemli

Bir dökümün arayanın anlamını koruyup korumadığını test etmek, bir sesli temsilcinin önemli ayrıntıları doğru şekilde ele alıp alamadığını, kelime uyuşmazlıklarını saymaktan daha iyi gösterebilir.

## Kaynaklar ve referanslar

1. [mu-bench: A Multilingual Utterance Transcription Benchmark](https://arxiv.org/abs/2609.32082) – arXiv, 2026-09-29

Son güncelleme: 2026-09-29
