Команда Lokutor выпустила Oído — модель распознавания речи, которая работает на микроконтроллере ESP32-S3 стоимостью около пяти долларов. В её основе — NVIDIA Conformer-CTC Small с 13 миллионами параметров. Модель квантовали до int8, чтобы она поместилась в 8 МБ оперативной памяти чипа. В тестах на наборе данных LibriSpeech показатель частоты ошибок в словах (WER) у Oído составил 3,7% на чистых записях и 8,2% на зашумлённых. Небольшая открытая модель OpenAI Whisper-tiny показала на тех же данных 6,3% и 15,9% соответственно при запуске на ноутбуке.
Команда также проверила Oído в условиях реальных шумов: в салоне автомобиля, на кухне и в кафетерии, а также при фоновом разговоре и реверберации. Средний WER составил 8,4%, тогда как у Whisper-tiny — 12,1%. С помощью скрипта для демонстрации в реальном времени можно подключить к ESP32 микрофон ноутбука и испытать вычисления непосредственно на чипе.
Весь код и веса модели опубликованы на GitHub по открытой лицензии. Энтузиасты и разработчики могут скачать систему, записать её в память устройства и самостоятельно поэкспериментировать.
Как это сравнить с другими решениями для устройств?
Для большинства систем распознавания речи на устройстве нужен специализированный нейропроцессор (NPU) или более дорогой процессор. Oído показывает, что обычный микроконтроллер с небольшим объёмом памяти способен превзойти более крупную программную модель, запущенную на полноценном ноутбуке. В результате получается компактное и недорогое устройство, которое понимает голосовые команды, не отправляя аудио в облако.
Почему это важно
Для обычных пользователей это означает, что недорогие устройства — например, гаджеты для умного дома — смогут распознавать речь локально, сохраняя конфиденциальность данных и меньше завися от интернета. Разработчики смогут создавать прототипы устройств с голосовым управлением без дорогого оборудования и платы за облачные API.