# LLM फ़िल्टर ने शोर वाले पुलिस ऑडियो के AI ट्रांसक्रिप्शन में गलतियाँ घटाईं

> शोधकर्ताओं ने शोर भरे पुलिस प्रसारणों की स्पीच रिकग्निशन के लिए छद्म-लेबलिंग बेहतर बनाने वाला LLM-आधारित फ़िल्टर पेश किया, जिससे ट्रांसक्रिप्शन की गलतियाँ कम हुईं।

Oossa · 2026-09-28 · https://oossa.com/hi/llm-filter-trims-errors-in-ai-transcriptions-of-noisy-police-audio

Kaavya Chaparala के नेतृत्व वाली टीम ने Baltimore और Chicago के शोर भरे पुलिस प्रसारणों पर स्पीच रिकग्निशन के दो फ़ाउंडेशन मॉडल—OpenAI का Whisper और Qwen3‑ASR—का मूल्यांकन किया। उन्होंने पाया कि मॉडलों के अपने कॉन्फिडेंस स्कोर मशीन से तैयार ट्रांसक्रिप्ट में अच्छे और खराब नतीजों को अलग नहीं कर पाए। संदर्भ के लिहाज़ से अविश्वसनीय छद्म-लेबल हटाने के लिए बाहरी निर्णायक के तौर पर एक बड़े भाषा मॉडल का इस्तेमाल करके उन्होंने प्रशिक्षण डेटा की शब्द-त्रुटि दर घटाई। SLT 2026 सम्मेलन में स्वीकृत इस पेपर में भविष्य की दिशा के तौर पर मॉडलों के बीच छद्म-लेबल की अदला-बदली का प्रस्ताव भी है।

## तथ्य

- पेपर SLT 2026 सम्मेलन में स्वीकृत हुआ
- Baltimore और Chicago के पुलिस ऑडियो पर Whisper और Qwen3‑ASR का मूल्यांकन किया गया

## यह क्यों मायने रखता है

इस तरीके से व्यापक मानवीय लेबलिंग के बिना शोर भरी पुलिस रिकॉर्डिंग को पढ़ने योग्य टेक्स्ट में बदलना कम खर्चीला और अधिक सटीक हो सकता है।

## स्रोत और संदर्भ

1. [Pretrained ASR Pseudo-labeling for Noisy Police Audio](https://arxiv.org/abs/2609.30469) – arXiv, 2026-09-28

अंतिम अपडेट: 2026-09-28
