Oossa

Oído让5美元ESP32微控制器实现语音识别

Lokutor开源模型Oído在廉价ESP32-S3开发板上的错误率低于Whisper-tiny。

OossaOossa 发布日期: 1 分钟阅读

Vishnu Mohanan · Unsplash

Lokutor团队发布了语音识别模型Oído,可在一款售价约5美元的ESP32-S3微控制器上运行。该模型采用拥有1300万参数的NVIDIA Conformer-CTC Small,并经过int8量化,能够装入芯片的8 MB内存。在LibriSpeech基准测试中,Oído在干净语音集上的词错误率(WER)为3.7%,在噪声语音集上为8.2%。OpenAI推出的小型开源模型Whisper-tiny在同一数据集上运行于笔记本电脑时,得分分别为6.3%和15.9%。

团队还在多种真实环境噪声下测试了Oído,包括车内、厨房、食堂,以及背景交谈和混响。其平均WER为8.4%,Whisper-tiny则为12.1%。团队还提供了实时演示脚本,任何人都可以将笔记本电脑的麦克风连接到ESP32,体验芯片的实际运算过程。

所有代码和模型权重均以开源许可证发布在GitHub上,爱好者和开发者可以自行下载、烧录并体验这套系统。

与其他端侧解决方案相比如何?

大多数端侧语音识别器都需要专用神经网络处理单元(NPU)或更昂贵的处理器。Oído表明,内存有限的普通微控制器,也能胜过运行在整台笔记本电脑上的大型软件模型。由此,设备既小巧又便宜,还能在不把音频发送到云端的情况下理解语音指令。

为什么重要

对普通用户来说,这意味着智能家居设备等低成本产品也能在本地识别语音,从而保护数据隐私,并减少对网络连接的依赖。开发者无需昂贵硬件或支付云端API费用,就能制作语音控制产品原型。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。