# Oído يتعرّف على الكلام عبر متحكّم ESP32 بسعر 5 دولارات

> يحقق نموذج Oído مفتوح المصدر من Lokutor معدل أخطاء أقل من Whisper‑tiny، ويعمل على لوحة ESP32‑S3 منخفضة التكلفة.

Oossa · 2026-09-30 · https://oossa.com/ar/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

أُعدّ وتُرجم بمساعدة الذكاء الاصطناعي. راجع المصادر الأصلية أدناه.

أطلق فريق Lokutor نموذج Oído للتعرّف على الكلام، وهو قادر على العمل على متحكّم ESP32‑S3 لا يتجاوز سعره نحو خمسة دولارات. ويضم النموذج 13 مليون مُعامل، وهو NVIDIA Conformer‑CTC Small، وقد خُفّضت دقته إلى int8 ليتّسع في ذاكرة الشريحة البالغة 8 ميغابايت. وفي اختبارات معيار LibriSpeech، سجّل Oído معدل خطأ في الكلمات (WER) بلغ 3.7% في مجموعة التسجيلات الواضحة و8.2% في المجموعة المشوّشة. أما Whisper‑tiny، وهو نموذج صغير مفتوح المصدر من OpenAI، فسجّل 6.3% و15.9% على البيانات نفسها عند تشغيله على حاسوب محمول.

اختبر الفريق Oído أيضاً في ظروف ضوضاء واقعية، شملت داخل السيارة والمطبخ والمقصف، إلى جانب الأحاديث الخلفية والصدى. وبلغ متوسط معدل الخطأ في الكلمات 8.4%، مقابل 12.1% لـWhisper‑tiny. كما يتيح برنامج عرض توضيحي مباشر لأي شخص توصيل ميكروفون حاسوبه المحمول بـESP32 وتجربة العمليات الحسابية نفسها على الشريحة.

نُشر كل من الشيفرة وأوزان النموذج بموجب ترخيص مفتوح المصدر على GitHub، ما يتيح للهواة والمطورين تنزيل النظام وبرمجته على الشريحة وتجربته بأنفسهم.

## كيف يقارن بالحلول الأخرى التي تعمل على الجهاز؟

تحتاج معظم أنظمة التعرّف على الكلام التي تعمل على الجهاز إلى وحدة مخصّصة لمعالجة الشبكات العصبية (NPU) أو معالج أعلى كلفة. ويُظهر Oído أن متحكّماً عادياً بذاكرة محدودة يمكنه التفوق على نموذج برمجي أكبر يعمل على حاسوب محمول كامل. والنتيجة جهاز صغير ومنخفض التكلفة يستطيع فهم الأوامر المنطوقة من دون إرسال الصوت إلى السحابة.

## الحقائق

- يستخدم Oído نموذج NVIDIA Conformer‑CTC Small، المؤلف من 13 مليون مُعامل والمخفّض إلى int8.
- يعمل على لوحة ESP32‑S3 يبلغ سعرها نحو 5 دولارات، وتضم 8 ميغابايت من ذاكرة PSRAM.
- معدل الخطأ في الكلمات على مجموعة LibriSpeech الواضحة: 3.7% لـOído مقابل 6.3% لـWhisper‑tiny؛ وعلى المجموعة المشوّشة: 8.2% مقابل 15.9%.
- متوسط معدل الخطأ في اختبار الضوضاء الواقعية: 8.4% لـOído مقابل 12.1% لـWhisper‑tiny.

## لماذا يهم

بالنسبة إلى المستخدمين، يعني ذلك أن أجهزة منخفضة التكلفة، مثل أدوات المنزل الذكي، يمكنها فهم الكلام محلياً، بما يحافظ على خصوصية البيانات ويقلل الاعتماد على الاتصال بالإنترنت. ويمكن للمطورين ابتكار نماذج أولية لمنتجات تعمل بالأوامر الصوتية من دون الحاجة إلى أجهزة باهظة أو رسوم واجهات برمجة التطبيقات السحابية.

## المصادر والمراجع

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

آخر تحديث: 2026-09-30
