# Oído riconosce il parlato su un microcontrollore ESP32 da 5 dollari

> Il modello open source Oído di Lokutor ha un tasso di errore inferiore a Whisper-tiny e funziona su una scheda ESP32-S3 economica.

Oossa · 2026-09-30 · https://oossa.com/it/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

Prodotto e tradotto con l’aiuto dell’IA. Consulta le fonti originali qui sotto.

Il team di Lokutor ha rilasciato Oído, un modello di riconoscimento vocale che può funzionare su un microcontrollore ESP32-S3 dal costo di circa cinque dollari. Il modello è un NVIDIA Conformer-CTC Small da 13 milioni di parametri, quantizzato a int8 per rientrare negli 8 MB di RAM del chip. Nei test sul benchmark LibriSpeech, Oído ha registrato un tasso di errore sulle parole (WER) del 3,7% nel set pulito e dell’8,2% in quello rumoroso. Whisper-tiny, un piccolo modello open source di OpenAI, ha ottenuto rispettivamente il 6,3% e il 15,9% sugli stessi dati, eseguito su un laptop.

Il team ha valutato Oído anche in condizioni di rumore reali: all’interno di un’auto, in cucina e in mensa, oltre che in presenza di chiacchiericcio di fondo e riverbero. Il WER medio è stato dell’8,4%, contro il 12,1% di Whisper-tiny. Uno script per una demo dal vivo permette a chiunque di collegare il microfono di un laptop all’ESP32 e provare direttamente i calcoli sul chip.

Tutto il codice e i pesi del modello sono disponibili su GitHub con una licenza open source: appassionati e sviluppatori possono scaricarli, caricarli sulla scheda e sperimentare autonomamente il sistema.

## Come si confronta con le altre soluzioni on-device?

La maggior parte dei sistemi di riconoscimento vocale on-device richiede un’unità di elaborazione neurale (NPU) dedicata o un processore più costoso. Oído dimostra che anche un normale microcontrollore con una quantità modesta di RAM può superare un modello software più grande eseguito su un laptop. Il risultato è un dispositivo piccolo ed economico, in grado di comprendere i comandi vocali senza inviare l’audio al cloud.

## I fatti

- Oído usa un modello NVIDIA Conformer-CTC Small da 13 milioni di parametri, quantizzato a int8.
- Funziona su una scheda ESP32-S3 che costa circa 5 dollari e dispone di 8 MB di PSRAM.
- WER su LibriSpeech, set pulito: Oído 3,7% contro Whisper-tiny 6,3%; set rumoroso: Oído 8,2% contro Whisper-tiny 15,9%.
- WER medio nei test con rumori reali: Oído 8,4% contro Whisper-tiny 12,1%.

## Perché conta

Per gli utenti comuni, significa che dispositivi economici come quelli per la smart home possono riconoscere il parlato in locale, tutelando la privacy e riducendo la dipendenza dalla connessione Internet. Gli sviluppatori possono realizzare prototipi di prodotti a controllo vocale senza hardware costoso né tariffe per le API cloud.

## Fonti e riferimenti

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

Ultimo aggiornamento: 2026-09-30
