Lokutor团队发布了语音识别模型Oído,可在一款售价约5美元的ESP32-S3微控制器上运行。该模型采用拥有1300万参数的NVIDIA Conformer-CTC Small,并经过int8量化,能够装入芯片的8 MB内存。在LibriSpeech基准测试中,Oído在干净语音集上的词错误率(WER)为3.7%,在噪声语音集上为8.2%。OpenAI推出的小型开源模型Whisper-tiny在同一数据集上运行于笔记本电脑时,得分分别为6.3%和15.9%。
团队还在多种真实环境噪声下测试了Oído,包括车内、厨房、食堂,以及背景交谈和混响。其平均WER为8.4%,Whisper-tiny则为12.1%。团队还提供了实时演示脚本,任何人都可以将笔记本电脑的麦克风连接到ESP32,体验芯片的实际运算过程。
所有代码和模型权重均以开源许可证发布在GitHub上,爱好者和开发者可以自行下载、烧录并体验这套系统。
与其他端侧解决方案相比如何?
大多数端侧语音识别器都需要专用神经网络处理单元(NPU)或更昂贵的处理器。Oído表明,内存有限的普通微控制器,也能胜过运行在整台笔记本电脑上的大型软件模型。由此,设备既小巧又便宜,还能在不把音频发送到云端的情况下理解语音指令。
为什么重要
对普通用户来说,这意味着智能家居设备等低成本产品也能在本地识别语音,从而保护数据隐私,并减少对网络连接的依赖。开发者无需昂贵硬件或支付云端API费用,就能制作语音控制产品原型。