# Oído تشخیص گفتار را روی میکروکنترلر ۵ دلاری اجرا می‌کند

> مدل متن‌باز Oído از شرکت Lokutor، با وجود اجرا روی برد ارزان ESP32-S3، نرخ خطای کمتری از Whisper-tiny دارد.

Oossa · 2026-09-30 · https://oossa.com/fa/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

با کمک هوش مصنوعی تهیه و ترجمه شده است. منابع اصلی زیر را بررسی کنید.

تیم Lokutor مدل تشخیص گفتار Oído را عرضه کرده است؛ مدلی که روی میکروکنترلر ESP32-S3 با قیمت حدود پنج دلار اجرا می‌شود. این مدل NVIDIA Conformer-CTC Small با ۱۳ میلیون پارامتر است که برای جاگرفتن در ۸ مگابایت حافظه رم تراشه، به int8 کوانتیزه شده است. Oído در آزمون‌های معیار LibriSpeech، برای مجموعه پاک نرخ خطای واژه (WER) برابر با ۳٫۷ درصد و برای مجموعه پرنویز ۸٫۲ درصد ثبت کرد. Whisper-tiny، مدل کوچک متن‌باز OpenAI، هنگام اجرا روی لپ‌تاپ در همین داده‌ها به‌ترتیب امتیازهای ۶٫۳ و ۱۵٫۹ درصد را به دست آورد.

تیم همچنین Oído را در شرایط پرنویز دنیای واقعی ارزیابی کرد؛ از جمله داخل خودرو، آشپزخانه و کافه‌تریا، و نیز در حضور همهمه پس‌زمینه و پژواک. میانگین WER این مدل ۸٫۴ درصد بود، درحالی‌که این رقم برای Whisper-tiny به ۱۲٫۱ درصد می‌رسید. یک اسکریپت نمایشی زنده به هر کسی امکان می‌دهد میکروفون لپ‌تاپ را به ESP32 وصل کند و محاسبات را مستقیماً روی خود تراشه امتحان کند.

تمام کدها و وزن‌های مدل با مجوز متن‌باز در GitHub منتشر شده‌اند تا علاقه‌مندان و توسعه‌دهندگان بتوانند آن‌ها را دانلود کنند، روی دستگاه نصب کنند و خودشان با سیستم کار کنند.

## این مدل در مقایسه با راهکارهای دیگرِ روی دستگاه چطور است؟

بیشتر سامانه‌های تشخیص گفتارِ روی دستگاه به واحد پردازش عصبی (NPU) اختصاصی یا پردازنده‌ای گران‌تر نیاز دارند. Oído نشان می‌دهد یک میکروکنترلر معمولی با حافظه رم محدود هم می‌تواند از یک مدل نرم‌افزاری بزرگ‌تر که روی لپ‌تاپ اجرا می‌شود بهتر عمل کند. نتیجه، دستگاهی کوچک و کم‌هزینه است که می‌تواند فرمان‌های گفتاری را بدون فرستادن صدا به فضای ابری بفهمد.

## حقایق

- Oído از مدل NVIDIA Conformer-CTC Small با ۱۳ میلیون پارامتر استفاده می‌کند که به int8 کوانتیزه شده است.
- این مدل روی برد ESP32-S3 با قیمت حدود ۵ دلار و ۸ مگابایت PSRAM اجرا می‌شود.
- WER در مجموعه پاک LibriSpeech: برابر با ۳٫۷ درصد برای Oído در برابر ۶٫۳ درصد برای Whisper-tiny؛ در مجموعه پرنویز: ۸٫۲ درصد برای Oído در برابر ۱۵٫۹ درصد برای Whisper-tiny.
- میانگین WER در آزمون نویز دنیای واقعی: ۸٫۴ درصد برای Oído در برابر ۱۲٫۱ درصد برای Whisper-tiny.

## چرا مهم است

برای کاربران عادی، این یعنی دستگاه‌های ارزان‌قیمتی مثل گجت‌های خانه هوشمند می‌توانند گفتار را به‌صورت محلی بفهمند؛ در نتیجه، داده‌ها خصوصی می‌مانند و وابستگی به اتصال اینترنت کمتر می‌شود. توسعه‌دهندگان هم می‌توانند بدون سخت‌افزار گران‌قیمت یا هزینه APIهای ابری، نمونه‌های اولیه محصولات کنترل‌شونده با صدا را بسازند.

## منابع و ارجاع‌ها

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

آخرین به‌روزرسانی: 2026-09-30
