Lokutor टीम ने Oído जारी किया है—यह स्पीच रिकग्निशन मॉडल करीब $5 के ESP32-S3 माइक्रोकंट्रोलर पर चल सकता है। 13 मिलियन पैरामीटर वाले NVIDIA Conformer-CTC Small मॉडल को int8 में क्वांटाइज़ किया गया है, ताकि वह चिप की 8 MB RAM में समा सके। LibriSpeech बेंचमार्क पर हुए परीक्षणों में Oído की वर्ड एरर रेट (WER) क्लीन सेट में 3.7% और नॉइज़ी सेट में 8.2% रही। OpenAI के छोटे ओपन-सोर्स मॉडल Whisper-tiny ने उसी डेटा पर लैपटॉप में चलाने पर क्रमशः 6.3% और 15.9% स्कोर किया।
टीम ने कार के अंदर, रसोई और कैफेटेरिया के शोर के साथ-साथ पीछे की बातचीत और गूंज जैसी वास्तविक परिस्थितियों में भी Oído का आकलन किया। इसमें औसत WER 8.4% रही, जबकि Whisper-tiny की 12.1% थी। लाइव डेमो स्क्रिप्ट की मदद से कोई भी लैपटॉप का माइक्रोफ़ोन ESP32 से जोड़कर चिप पर होने वाली गणना को खुद आज़मा सकता है।
सारा कोड और मॉडल वेट GitHub पर ओपन-सोर्स लाइसेंस के तहत जारी किए गए हैं। शौकिया उपयोगकर्ता और डेवलपर इन्हें डाउनलोड करके सिस्टम में फ्लैश कर सकते हैं और इसके साथ प्रयोग कर सकते हैं।
यह डिवाइस पर चलने वाले दूसरे समाधानों से कैसे अलग है?
डिवाइस पर चलने वाले ज़्यादातर स्पीच रिकग्निशन सिस्टम के लिए डेडिकेटेड न्यूरल प्रोसेसिंग यूनिट (NPU) या अधिक महंगे प्रोसेसर की ज़रूरत होती है। Oído दिखाता है कि सीमित RAM वाला साधारण माइक्रोकंट्रोलर भी पूरे लैपटॉप पर चलने वाले बड़े सॉफ़्टवेयर मॉडल से बेहतर प्रदर्शन कर सकता है। नतीजा है एक छोटा, कम लागत वाला डिवाइस, जो ऑडियो क्लाउड पर भेजे बिना बोले गए आदेश समझ सकता है।
यह क्यों मायने रखता है
आम उपयोगकर्ताओं के लिए इसका मतलब है कि स्मार्ट होम गैजेट जैसे सस्ते उपकरण स्थानीय स्तर पर आवाज़ समझ सकते हैं। इससे डेटा निजी रहता है और इंटरनेट कनेक्शन पर निर्भरता घटती है। डेवलपर महंगे हार्डवेयर या क्लाउड API शुल्क के बिना वॉइस-कंट्रोल वाले उत्पादों के प्रोटोटाइप बना सकते हैं।