# Oído reconhece fala em microcontrolador ESP32 de US$ 5

> O modelo de código aberto da Lokutor apresenta taxas de erro menores que as do Whisper-tiny e roda em uma placa ESP32-S3 de baixo custo.

Oossa · 2026-09-30 · https://oossa.com/pt/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

Produzido e traduzido com auxílio de IA. Consulte as fontes originais abaixo.

A equipe da Lokutor lançou o Oído, um modelo de reconhecimento de fala que roda em um microcontrolador ESP32-S3 de cerca de US$ 5. O modelo NVIDIA Conformer-CTC Small tem 13 milhões de parâmetros e foi quantizado para int8, para caber nos 8 MB de RAM do chip. Nos testes com o benchmark LibriSpeech, o Oído registrou uma taxa de erro por palavra (WER) de 3,7% no conjunto limpo e de 8,2% no conjunto com ruído. O Whisper-tiny, pequeno modelo de código aberto da OpenAI, teve resultados de 6,3% e 15,9% nos mesmos dados, quando executado em um laptop.

A equipe também avaliou o Oído em condições de ruído do mundo real — dentro de um carro, em uma cozinha e em uma cafeteria, além de testar conversas ao fundo e reverberação. A WER média foi de 8,4%, enquanto a do Whisper-tiny ficou em 12,1%. Um script de demonstração ao vivo permite conectar o microfone de um laptop ao ESP32 e testar os cálculos diretamente no chip.

Todo o código e os pesos do modelo foram disponibilizados sob uma licença de código aberto no GitHub, para que entusiastas e desenvolvedores possam baixar, instalar e experimentar o sistema.

## Como ele se compara a outras soluções locais?

A maioria dos sistemas de reconhecimento de fala executados no próprio dispositivo precisa de uma unidade de processamento neural (NPU) dedicada ou de um processador mais caro. O Oído mostra que um microcontrolador comum, com uma quantidade modesta de RAM, ainda pode superar um modelo de software maior rodando em um laptop. O resultado é um dispositivo pequeno e barato, capaz de entender comandos de voz sem enviar áudio para a nuvem.

## Os fatos

- O Oído usa o modelo NVIDIA Conformer-CTC Small, com 13 milhões de parâmetros, quantizado para int8.
- Ele roda em uma placa ESP32-S3 que custa cerca de US$ 5 e tem 8 MB de PSRAM.
- WER no LibriSpeech limpo: Oído 3,7% contra Whisper-tiny 6,3%; WER com ruído: Oído 8,2% contra Whisper-tiny 15,9%.
- WER média nos testes com ruído do mundo real: Oído 8,4% contra Whisper-tiny 12,1%.

## Por que importa

Para os usuários, isso significa que dispositivos baratos, como aparelhos domésticos inteligentes, podem reconhecer a fala localmente, preservando a privacidade dos dados e reduzindo a dependência da internet. Desenvolvedores podem criar protótipos de produtos controlados por voz sem precisar de hardware caro nem pagar por APIs na nuvem.

## Fontes e referências

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

Última atualização: 2026-09-30
