تیم Lokutor مدل تشخیص گفتار Oído را عرضه کرده است؛ مدلی که روی میکروکنترلر ESP32-S3 با قیمت حدود پنج دلار اجرا میشود. این مدل NVIDIA Conformer-CTC Small با ۱۳ میلیون پارامتر است که برای جاگرفتن در ۸ مگابایت حافظه رم تراشه، به int8 کوانتیزه شده است. Oído در آزمونهای معیار LibriSpeech، برای مجموعه پاک نرخ خطای واژه (WER) برابر با ۳٫۷ درصد و برای مجموعه پرنویز ۸٫۲ درصد ثبت کرد. Whisper-tiny، مدل کوچک متنباز OpenAI، هنگام اجرا روی لپتاپ در همین دادهها بهترتیب امتیازهای ۶٫۳ و ۱۵٫۹ درصد را به دست آورد.
تیم همچنین Oído را در شرایط پرنویز دنیای واقعی ارزیابی کرد؛ از جمله داخل خودرو، آشپزخانه و کافهتریا، و نیز در حضور همهمه پسزمینه و پژواک. میانگین WER این مدل ۸٫۴ درصد بود، درحالیکه این رقم برای Whisper-tiny به ۱۲٫۱ درصد میرسید. یک اسکریپت نمایشی زنده به هر کسی امکان میدهد میکروفون لپتاپ را به ESP32 وصل کند و محاسبات را مستقیماً روی خود تراشه امتحان کند.
تمام کدها و وزنهای مدل با مجوز متنباز در GitHub منتشر شدهاند تا علاقهمندان و توسعهدهندگان بتوانند آنها را دانلود کنند، روی دستگاه نصب کنند و خودشان با سیستم کار کنند.
این مدل در مقایسه با راهکارهای دیگرِ روی دستگاه چطور است؟
بیشتر سامانههای تشخیص گفتارِ روی دستگاه به واحد پردازش عصبی (NPU) اختصاصی یا پردازندهای گرانتر نیاز دارند. Oído نشان میدهد یک میکروکنترلر معمولی با حافظه رم محدود هم میتواند از یک مدل نرمافزاری بزرگتر که روی لپتاپ اجرا میشود بهتر عمل کند. نتیجه، دستگاهی کوچک و کمهزینه است که میتواند فرمانهای گفتاری را بدون فرستادن صدا به فضای ابری بفهمد.
چرا مهم است
برای کاربران عادی، این یعنی دستگاههای ارزانقیمتی مثل گجتهای خانه هوشمند میتوانند گفتار را بهصورت محلی بفهمند؛ در نتیجه، دادهها خصوصی میمانند و وابستگی به اتصال اینترنت کمتر میشود. توسعهدهندگان هم میتوانند بدون سختافزار گرانقیمت یا هزینه APIهای ابری، نمونههای اولیه محصولات کنترلشونده با صدا را بسازند.