# 5ドルのESP32で音声認識を実現する「Oído」

> Lokutorのオープンソースモデル「Oído」は、安価なESP32-S3ボード上で動作し、Whisper-tinyより低い誤り率を達成した。

Oossa · 2026-09-30 · https://oossa.com/ja/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

AIの支援で作成・翻訳しています。以下の原典をご確認ください。

Lokutorチームは、約5ドルのESP32-S3マイクロコントローラー上で動作する音声認識モデル「Oído」を公開した。モデルはパラメーター数1,300万のNVIDIA Conformer-CTC Smallで、チップの8MB RAMに収まるようint8に量子化されている。LibriSpeechベンチマークでの単語誤り率（WER）は、クリーン音声で3.7％、ノイズの多い音声で8.2％だった。OpenAIの小型オープンソースモデルWhisper-tinyは、同じデータをノートPCで処理した場合、それぞれ6.3％と15.9％だった。

チームはさらに、車内、キッチン、カフェテリアに加え、周囲の話し声や残響がある実環境のノイズ条件でもOídoを評価した。平均WERは8.4％で、Whisper-tinyは12.1％だった。ライブデモ用のスクリプトを使えば、ノートPCのマイクをESP32に接続し、チップ上での実際の演算を試せる。

コードとモデルの重みはすべてオープンソースライセンスでGitHubに公開されており、愛好家や開発者はダウンロードして書き込み、システムを試すことができる。

## ほかのデバイス上音声認識と比べると？

デバイス上で動作する音声認識システムの多くは、専用のニューラル処理ユニット（NPU）や、より高価なプロセッサーを必要とする。Oídoは、RAMが限られた一般的なマイクロコントローラーでも、ノートPC上で動くより大規模なソフトウェアモデルを上回れることを示した。音声をクラウドに送信せずに音声コマンドを理解できる、小型で低価格なデバイスが実現する。

## 事実

- Oídoは、パラメーター数1,300万のNVIDIA Conformer-CTC Smallモデルをint8に量子化して使用する。
- 約5ドルで8MBのPSRAMを搭載するESP32-S3ボード上で動作する。
- LibriSpeechのクリーン音声でのWER：Oídoは3.7％、Whisper-tinyは6.3％。ノイズ音声ではOídoが8.2％、Whisper-tinyが15.9％。
- 実環境ノイズテストの平均WER：Oídoは8.4％、Whisper-tinyは12.1％。

## なぜ重要か

一般ユーザーにとっては、スマートホーム機器のような安価なデバイスが音声をローカルで認識でき、データのプライバシーを守りながらインターネット接続への依存も減らせることを意味する。開発者は、高価なハードウェアやクラウドAPIの利用料をかけずに、音声操作製品の試作ができる。

## 出典と参考資料

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

最終更新: 2026-09-30
