Oossa

5ドルのESP32で音声認識を実現する「Oído」

Lokutorのオープンソースモデル「Oído」は、安価なESP32-S3ボード上で動作し、Whisper-tinyより低い誤り率を達成した。

OossaOossa公開日: 1 分で読める

Vishnu Mohanan · Unsplash

Lokutorチームは、約5ドルのESP32-S3マイクロコントローラー上で動作する音声認識モデル「Oído」を公開した。モデルはパラメーター数1,300万のNVIDIA Conformer-CTC Smallで、チップの8MB RAMに収まるようint8に量子化されている。LibriSpeechベンチマークでの単語誤り率(WER)は、クリーン音声で3.7%、ノイズの多い音声で8.2%だった。OpenAIの小型オープンソースモデルWhisper-tinyは、同じデータをノートPCで処理した場合、それぞれ6.3%と15.9%だった。

チームはさらに、車内、キッチン、カフェテリアに加え、周囲の話し声や残響がある実環境のノイズ条件でもOídoを評価した。平均WERは8.4%で、Whisper-tinyは12.1%だった。ライブデモ用のスクリプトを使えば、ノートPCのマイクをESP32に接続し、チップ上での実際の演算を試せる。

コードとモデルの重みはすべてオープンソースライセンスでGitHubに公開されており、愛好家や開発者はダウンロードして書き込み、システムを試すことができる。

ほかのデバイス上音声認識と比べると?

デバイス上で動作する音声認識システムの多くは、専用のニューラル処理ユニット(NPU)や、より高価なプロセッサーを必要とする。Oídoは、RAMが限られた一般的なマイクロコントローラーでも、ノートPC上で動くより大規模なソフトウェアモデルを上回れることを示した。音声をクラウドに送信せずに音声コマンドを理解できる、小型で低価格なデバイスが実現する。

なぜ重要か

一般ユーザーにとっては、スマートホーム機器のような安価なデバイスが音声をローカルで認識でき、データのプライバシーを守りながらインターネット接続への依存も減らせることを意味する。開発者は、高価なハードウェアやクラウドAPIの利用料をかけずに、音声操作製品の試作ができる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。