A equipe da Lokutor lançou o Oído, um modelo de reconhecimento de fala que roda em um microcontrolador ESP32-S3 de cerca de US$ 5. O modelo NVIDIA Conformer-CTC Small tem 13 milhões de parâmetros e foi quantizado para int8, para caber nos 8 MB de RAM do chip. Nos testes com o benchmark LibriSpeech, o Oído registrou uma taxa de erro por palavra (WER) de 3,7% no conjunto limpo e de 8,2% no conjunto com ruído. O Whisper-tiny, pequeno modelo de código aberto da OpenAI, teve resultados de 6,3% e 15,9% nos mesmos dados, quando executado em um laptop.
A equipe também avaliou o Oído em condições de ruído do mundo real — dentro de um carro, em uma cozinha e em uma cafeteria, além de testar conversas ao fundo e reverberação. A WER média foi de 8,4%, enquanto a do Whisper-tiny ficou em 12,1%. Um script de demonstração ao vivo permite conectar o microfone de um laptop ao ESP32 e testar os cálculos diretamente no chip.
Todo o código e os pesos do modelo foram disponibilizados sob uma licença de código aberto no GitHub, para que entusiastas e desenvolvedores possam baixar, instalar e experimentar o sistema.
Como ele se compara a outras soluções locais?
A maioria dos sistemas de reconhecimento de fala executados no próprio dispositivo precisa de uma unidade de processamento neural (NPU) dedicada ou de um processador mais caro. O Oído mostra que um microcontrolador comum, com uma quantidade modesta de RAM, ainda pode superar um modelo de software maior rodando em um laptop. O resultado é um dispositivo pequeno e barato, capaz de entender comandos de voz sem enviar áudio para a nuvem.
Por que importa
Para os usuários, isso significa que dispositivos baratos, como aparelhos domésticos inteligentes, podem reconhecer a fala localmente, preservando a privacidade dos dados e reduzindo a dependência da internet. Desenvolvedores podem criar protótipos de produtos controlados por voz sem precisar de hardware caro nem pagar por APIs na nuvem.