संक्षिप्त · 1 मिनट पढ़ना
LLM फ़िल्टर ने शोर वाले पुलिस ऑडियो के AI ट्रांसक्रिप्शन में गलतियाँ घटाईं
शोधकर्ताओं ने शोर भरे पुलिस प्रसारणों की स्पीच रिकग्निशन के लिए छद्म-लेबलिंग बेहतर बनाने वाला LLM-आधारित फ़िल्टर पेश किया, जिससे ट्रांसक्रिप्शन की गलतियाँ कम हुईं।
Oossa · Oossa के बारे में
Kaavya Chaparala के नेतृत्व वाली टीम ने Baltimore और Chicago के शोर भरे पुलिस प्रसारणों पर स्पीच रिकग्निशन के दो फ़ाउंडेशन मॉडल—OpenAI का Whisper और Qwen3‑ASR—का मूल्यांकन किया। उन्होंने पाया कि मॉडलों के अपने कॉन्फिडेंस स्कोर मशीन से तैयार ट्रांसक्रिप्ट में अच्छे और खराब नतीजों को अलग नहीं कर पाए। संदर्भ के लिहाज़ से अविश्वसनीय छद्म-लेबल हटाने के लिए बाहरी निर्णायक के तौर पर एक बड़े भाषा मॉडल का इस्तेमाल करके उन्होंने प्रशिक्षण डेटा की शब्द-त्रुटि दर घटाई। SLT 2026 सम्मेलन में स्वीकृत इस पेपर में भविष्य की दिशा के तौर पर मॉडलों के बीच छद्म-लेबल की अदला-बदली का प्रस्ताव भी है।
यह क्यों मायने रखता है
इस तरीके से व्यापक मानवीय लेबलिंग के बिना शोर भरी पुलिस रिकॉर्डिंग को पढ़ने योग्य टेक्स्ट में बदलना कम खर्चीला और अधिक सटीक हो सकता है।
स्रोत और संदर्भ
| # | स्रोत | प्रकाशक | तारीख | मुख्य बात |
|---|---|---|---|---|
| 1 | Pretrained ASR Pseudo-labeling for Noisy Police Audio ↗ | arXiv | 28 सित॰ 2026 | arXiv:2609.30469v1 Announce Type: new Abstract: Pretrained ASR systems perform poorly on noisy Broadcast Police Communication (BPC), hinderi |
1 स्रोत
अंतिम अपडेट:
Oossa · न्यूज़लेटर
AI का हफ़्ता, आसान भाषा में
हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।