# Oído распознаёт речь на микроконтроллере ESP32 за $5

> Открытая модель Oído от Lokutor ошибается реже, чем Whisper-tiny, и работает на недорогой плате ESP32-S3.

Oossa · 2026-09-30 · https://oossa.com/ru/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

Создано и переведено с помощью ИИ. Проверьте первоисточники ниже.

Команда Lokutor выпустила Oído — модель распознавания речи, которая работает на микроконтроллере ESP32-S3 стоимостью около пяти долларов. В её основе — NVIDIA Conformer-CTC Small с 13 миллионами параметров. Модель квантовали до int8, чтобы она поместилась в 8 МБ оперативной памяти чипа. В тестах на наборе данных LibriSpeech показатель частоты ошибок в словах (WER) у Oído составил 3,7% на чистых записях и 8,2% на зашумлённых. Небольшая открытая модель OpenAI Whisper-tiny показала на тех же данных 6,3% и 15,9% соответственно при запуске на ноутбуке.

Команда также проверила Oído в условиях реальных шумов: в салоне автомобиля, на кухне и в кафетерии, а также при фоновом разговоре и реверберации. Средний WER составил 8,4%, тогда как у Whisper-tiny — 12,1%. С помощью скрипта для демонстрации в реальном времени можно подключить к ESP32 микрофон ноутбука и испытать вычисления непосредственно на чипе.

Весь код и веса модели опубликованы на GitHub по открытой лицензии. Энтузиасты и разработчики могут скачать систему, записать её в память устройства и самостоятельно поэкспериментировать.

## Как это сравнить с другими решениями для устройств?

Для большинства систем распознавания речи на устройстве нужен специализированный нейропроцессор (NPU) или более дорогой процессор. Oído показывает, что обычный микроконтроллер с небольшим объёмом памяти способен превзойти более крупную программную модель, запущенную на полноценном ноутбуке. В результате получается компактное и недорогое устройство, которое понимает голосовые команды, не отправляя аудио в облако.

## Факты

- Oído использует 13-миллионную модель NVIDIA Conformer-CTC Small, квантованную до int8.
- Модель работает на плате ESP32-S3 стоимостью около $5 с 8 МБ PSRAM.
- WER на чистых записях LibriSpeech: Oído — 3,7%, Whisper-tiny — 6,3%; на зашумлённых: Oído — 8,2%, Whisper-tiny — 15,9%.
- Средний WER в тесте с реальными шумами: Oído — 8,4%, Whisper-tiny — 12,1%.

## Почему это важно

Для обычных пользователей это означает, что недорогие устройства — например, гаджеты для умного дома — смогут распознавать речь локально, сохраняя конфиденциальность данных и меньше завися от интернета. Разработчики смогут создавать прототипы устройств с голосовым управлением без дорогого оборудования и платы за облачные API.

## Источники и ссылки

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

Обновлено: 2026-09-30
