أطلق فريق Lokutor نموذج Oído للتعرّف على الكلام، وهو قادر على العمل على متحكّم ESP32‑S3 لا يتجاوز سعره نحو خمسة دولارات. ويضم النموذج 13 مليون مُعامل، وهو NVIDIA Conformer‑CTC Small، وقد خُفّضت دقته إلى int8 ليتّسع في ذاكرة الشريحة البالغة 8 ميغابايت. وفي اختبارات معيار LibriSpeech، سجّل Oído معدل خطأ في الكلمات (WER) بلغ 3.7% في مجموعة التسجيلات الواضحة و8.2% في المجموعة المشوّشة. أما Whisper‑tiny، وهو نموذج صغير مفتوح المصدر من OpenAI، فسجّل 6.3% و15.9% على البيانات نفسها عند تشغيله على حاسوب محمول.
اختبر الفريق Oído أيضاً في ظروف ضوضاء واقعية، شملت داخل السيارة والمطبخ والمقصف، إلى جانب الأحاديث الخلفية والصدى. وبلغ متوسط معدل الخطأ في الكلمات 8.4%، مقابل 12.1% لـWhisper‑tiny. كما يتيح برنامج عرض توضيحي مباشر لأي شخص توصيل ميكروفون حاسوبه المحمول بـESP32 وتجربة العمليات الحسابية نفسها على الشريحة.
نُشر كل من الشيفرة وأوزان النموذج بموجب ترخيص مفتوح المصدر على GitHub، ما يتيح للهواة والمطورين تنزيل النظام وبرمجته على الشريحة وتجربته بأنفسهم.
كيف يقارن بالحلول الأخرى التي تعمل على الجهاز؟
تحتاج معظم أنظمة التعرّف على الكلام التي تعمل على الجهاز إلى وحدة مخصّصة لمعالجة الشبكات العصبية (NPU) أو معالج أعلى كلفة. ويُظهر Oído أن متحكّماً عادياً بذاكرة محدودة يمكنه التفوق على نموذج برمجي أكبر يعمل على حاسوب محمول كامل. والنتيجة جهاز صغير ومنخفض التكلفة يستطيع فهم الأوامر المنطوقة من دون إرسال الصوت إلى السحابة.
لماذا يهم
بالنسبة إلى المستخدمين، يعني ذلك أن أجهزة منخفضة التكلفة، مثل أدوات المنزل الذكي، يمكنها فهم الكلام محلياً، بما يحافظ على خصوصية البيانات ويقلل الاعتماد على الاتصال بالإنترنت. ويمكن للمطورين ابتكار نماذج أولية لمنتجات تعمل بالأوامر الصوتية من دون الحاجة إلى أجهزة باهظة أو رسوم واجهات برمجة التطبيقات السحابية.