Oossa

Oído reconhece fala em microcontrolador ESP32 de US$ 5

O modelo de código aberto da Lokutor apresenta taxas de erro menores que as do Whisper-tiny e roda em uma placa ESP32-S3 de baixo custo.

OossaPublicado pelo Oossa: 1 min de leitura

Vishnu Mohanan · Unsplash

A equipe da Lokutor lançou o Oído, um modelo de reconhecimento de fala que roda em um microcontrolador ESP32-S3 de cerca de US$ 5. O modelo NVIDIA Conformer-CTC Small tem 13 milhões de parâmetros e foi quantizado para int8, para caber nos 8 MB de RAM do chip. Nos testes com o benchmark LibriSpeech, o Oído registrou uma taxa de erro por palavra (WER) de 3,7% no conjunto limpo e de 8,2% no conjunto com ruído. O Whisper-tiny, pequeno modelo de código aberto da OpenAI, teve resultados de 6,3% e 15,9% nos mesmos dados, quando executado em um laptop.

A equipe também avaliou o Oído em condições de ruído do mundo real — dentro de um carro, em uma cozinha e em uma cafeteria, além de testar conversas ao fundo e reverberação. A WER média foi de 8,4%, enquanto a do Whisper-tiny ficou em 12,1%. Um script de demonstração ao vivo permite conectar o microfone de um laptop ao ESP32 e testar os cálculos diretamente no chip.

Todo o código e os pesos do modelo foram disponibilizados sob uma licença de código aberto no GitHub, para que entusiastas e desenvolvedores possam baixar, instalar e experimentar o sistema.

Como ele se compara a outras soluções locais?

A maioria dos sistemas de reconhecimento de fala executados no próprio dispositivo precisa de uma unidade de processamento neural (NPU) dedicada ou de um processador mais caro. O Oído mostra que um microcontrolador comum, com uma quantidade modesta de RAM, ainda pode superar um modelo de software maior rodando em um laptop. O resultado é um dispositivo pequeno e barato, capaz de entender comandos de voz sem enviar áudio para a nuvem.

Por que importa

Para os usuários, isso significa que dispositivos baratos, como aparelhos domésticos inteligentes, podem reconhecer a fala localmente, preservando a privacidade dos dados e reduzindo a dependência da internet. Desenvolvedores podem criar protótipos de produtos controlados por voz sem precisar de hardware caro nem pagar por APIs na nuvem.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.