# Oído: $5 के ESP32 पर चलता है स्पीच रिकग्निशन

> Lokutor का ओपन-सोर्स Oído मॉडल सस्ते ESP32-S3 बोर्ड पर चलते हुए Whisper-tiny से कम त्रुटि दर हासिल करता है।

Oossa · 2026-09-30 · https://oossa.com/hi/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

AI की सहायता से तैयार और अनुवादित। नीचे मूल स्रोत देखें।

Lokutor टीम ने Oído जारी किया है—यह स्पीच रिकग्निशन मॉडल करीब $5 के ESP32-S3 माइक्रोकंट्रोलर पर चल सकता है। 13 मिलियन पैरामीटर वाले NVIDIA Conformer-CTC Small मॉडल को int8 में क्वांटाइज़ किया गया है, ताकि वह चिप की 8 MB RAM में समा सके। LibriSpeech बेंचमार्क पर हुए परीक्षणों में Oído की वर्ड एरर रेट (WER) क्लीन सेट में 3.7% और नॉइज़ी सेट में 8.2% रही। OpenAI के छोटे ओपन-सोर्स मॉडल Whisper-tiny ने उसी डेटा पर लैपटॉप में चलाने पर क्रमशः 6.3% और 15.9% स्कोर किया।

टीम ने कार के अंदर, रसोई और कैफेटेरिया के शोर के साथ-साथ पीछे की बातचीत और गूंज जैसी वास्तविक परिस्थितियों में भी Oído का आकलन किया। इसमें औसत WER 8.4% रही, जबकि Whisper-tiny की 12.1% थी। लाइव डेमो स्क्रिप्ट की मदद से कोई भी लैपटॉप का माइक्रोफ़ोन ESP32 से जोड़कर चिप पर होने वाली गणना को खुद आज़मा सकता है।

सारा कोड और मॉडल वेट GitHub पर ओपन-सोर्स लाइसेंस के तहत जारी किए गए हैं। शौकिया उपयोगकर्ता और डेवलपर इन्हें डाउनलोड करके सिस्टम में फ्लैश कर सकते हैं और इसके साथ प्रयोग कर सकते हैं।

## यह डिवाइस पर चलने वाले दूसरे समाधानों से कैसे अलग है?

डिवाइस पर चलने वाले ज़्यादातर स्पीच रिकग्निशन सिस्टम के लिए डेडिकेटेड न्यूरल प्रोसेसिंग यूनिट (NPU) या अधिक महंगे प्रोसेसर की ज़रूरत होती है। Oído दिखाता है कि सीमित RAM वाला साधारण माइक्रोकंट्रोलर भी पूरे लैपटॉप पर चलने वाले बड़े सॉफ़्टवेयर मॉडल से बेहतर प्रदर्शन कर सकता है। नतीजा है एक छोटा, कम लागत वाला डिवाइस, जो ऑडियो क्लाउड पर भेजे बिना बोले गए आदेश समझ सकता है।

## तथ्य

- Oído में 13 मिलियन पैरामीटर वाला NVIDIA Conformer-CTC Small मॉडल इस्तेमाल होता है, जिसे int8 में क्वांटाइज़ किया गया है।
- यह करीब $5 के ESP32-S3 बोर्ड पर चलता है, जिसमें 8 MB PSRAM है।
- LibriSpeech क्लीन WER: Oído 3.7% बनाम Whisper-tiny 6.3%; नॉइज़ी WER: Oído 8.2% बनाम Whisper-tiny 15.9%।
- वास्तविक शोर की परिस्थितियों में औसत WER: Oído 8.4% बनाम Whisper-tiny 12.1%।

## यह क्यों मायने रखता है

आम उपयोगकर्ताओं के लिए इसका मतलब है कि स्मार्ट होम गैजेट जैसे सस्ते उपकरण स्थानीय स्तर पर आवाज़ समझ सकते हैं। इससे डेटा निजी रहता है और इंटरनेट कनेक्शन पर निर्भरता घटती है। डेवलपर महंगे हार्डवेयर या क्लाउड API शुल्क के बिना वॉइस-कंट्रोल वाले उत्पादों के प्रोटोटाइप बना सकते हैं।

## स्रोत और संदर्भ

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

अंतिम अपडेट: 2026-09-30
