# Oído reconoce voz en un microcontrolador ESP32 de US$5

> El modelo de código abierto Oído de Lokutor logra una tasa de error menor que Whisper-tiny y funciona en una económica placa ESP32-S3.

Oossa · 2026-09-30 · https://oossa.com/es/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

Creado y traducido con ayuda de IA. Consulta las fuentes originales abajo.

El equipo de Lokutor lanzó Oído, un modelo de reconocimiento de voz que funciona en un microcontrolador ESP32-S3 que cuesta unos cinco dólares. El modelo NVIDIA Conformer-CTC Small tiene 13 millones de parámetros y está cuantizado a int8 para que quepa en los 8 MB de RAM del chip. En las pruebas con el benchmark LibriSpeech, Oído registró una tasa de error por palabra (WER) del 3,7 % en el conjunto limpio y del 8,2 % en el conjunto con ruido. Whisper-tiny, un pequeño modelo de código abierto de OpenAI, obtuvo un 6,3 % y un 15,9 % con los mismos datos al ejecutarse en una computadora portátil.

El equipo también evaluó Oído en condiciones de ruido del mundo real: el interior de un auto, una cocina y una cafetería, además de conversaciones de fondo y reverberación. La WER promedio fue del 8,4 %, frente al 12,1 % de Whisper-tiny. Un script de demostración en vivo permite conectar el micrófono de una computadora portátil al ESP32 y probar las operaciones exactas del chip.

Todo el código y los pesos del modelo se publicaron en GitHub con una licencia de código abierto, para que aficionados y desarrolladores puedan descargar el sistema, instalarlo en el dispositivo y experimentar por su cuenta.

## ¿Cómo se compara con otras soluciones en el dispositivo?

La mayoría de los sistemas de reconocimiento de voz que funcionan en el dispositivo necesitan una unidad de procesamiento neuronal (NPU) dedicada o un procesador más caro. Oído demuestra que un microcontrolador convencional con una cantidad modesta de RAM puede superar a un modelo de software más grande que se ejecuta en una computadora portátil. El resultado es un dispositivo pequeño y económico que puede entender comandos de voz sin enviar audio a la nube.

## Los hechos

- Oído usa un modelo NVIDIA Conformer-CTC Small de 13 millones de parámetros, cuantizado a int8.
- Funciona en una placa ESP32-S3 que cuesta unos US$5 y tiene 8 MB de PSRAM.
- WER en LibriSpeech, conjunto limpio: Oído 3,7 % frente a Whisper-tiny 6,3 %; conjunto con ruido: Oído 8,2 % frente a Whisper-tiny 15,9 %.
- WER promedio en la prueba con ruido del mundo real: Oído 8,4 % frente a Whisper-tiny 12,1 %.

## Por qué importa

Para los usuarios, esto significa que dispositivos económicos, como los aparatos inteligentes para el hogar, pueden entender la voz de forma local, proteger la privacidad de los datos y depender menos de la conexión a internet. Los desarrolladores pueden crear prototipos de productos controlados por voz sin recurrir a hardware costoso ni pagar por API en la nube.

## Fuentes y referencias

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

Última actualización: 2026-09-30
