# Oído让5美元ESP32微控制器实现语音识别

> Lokutor开源模型Oído在廉价ESP32-S3开发板上的错误率低于Whisper-tiny。

Oossa · 2026-09-30 · https://oossa.com/zh/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

借助 AI 编写和翻译。请核对下方原始来源。

Lokutor团队发布了语音识别模型Oído，可在一款售价约5美元的ESP32-S3微控制器上运行。该模型采用拥有1300万参数的NVIDIA Conformer-CTC Small，并经过int8量化，能够装入芯片的8 MB内存。在LibriSpeech基准测试中，Oído在干净语音集上的词错误率（WER）为3.7%，在噪声语音集上为8.2%。OpenAI推出的小型开源模型Whisper-tiny在同一数据集上运行于笔记本电脑时，得分分别为6.3%和15.9%。

团队还在多种真实环境噪声下测试了Oído，包括车内、厨房、食堂，以及背景交谈和混响。其平均WER为8.4%，Whisper-tiny则为12.1%。团队还提供了实时演示脚本，任何人都可以将笔记本电脑的麦克风连接到ESP32，体验芯片的实际运算过程。

所有代码和模型权重均以开源许可证发布在GitHub上，爱好者和开发者可以自行下载、烧录并体验这套系统。

## 与其他端侧解决方案相比如何？

大多数端侧语音识别器都需要专用神经网络处理单元（NPU）或更昂贵的处理器。Oído表明，内存有限的普通微控制器，也能胜过运行在整台笔记本电脑上的大型软件模型。由此，设备既小巧又便宜，还能在不把音频发送到云端的情况下理解语音指令。

## 事实

- Oído采用拥有1300万参数的NVIDIA Conformer-CTC Small模型，并经过int8量化。
- 该模型运行于售价约5美元、配备8 MB PSRAM的ESP32-S3开发板上。
- LibriSpeech干净语音集WER：Oído为3.7%，Whisper-tiny为6.3%；噪声语音集WER：Oído为8.2%，Whisper-tiny为15.9%。
- 真实环境噪声测试平均WER：Oído为8.4%，Whisper-tiny为12.1%。

## 为什么重要

对普通用户来说，这意味着智能家居设备等低成本产品也能在本地识别语音，从而保护数据隐私，并减少对网络连接的依赖。开发者无需昂贵硬件或支付云端API费用，就能制作语音控制产品原型。

## 来源与参考

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

最后更新: 2026-09-30
