Oossa

Oído riconosce il parlato su un microcontrollore ESP32 da 5 dollari

Il modello open source Oído di Lokutor ha un tasso di errore inferiore a Whisper-tiny e funziona su una scheda ESP32-S3 economica.

OossaPubblicato da Oossa: 1 min di lettura

Vishnu Mohanan · Unsplash

Il team di Lokutor ha rilasciato Oído, un modello di riconoscimento vocale che può funzionare su un microcontrollore ESP32-S3 dal costo di circa cinque dollari. Il modello è un NVIDIA Conformer-CTC Small da 13 milioni di parametri, quantizzato a int8 per rientrare negli 8 MB di RAM del chip. Nei test sul benchmark LibriSpeech, Oído ha registrato un tasso di errore sulle parole (WER) del 3,7% nel set pulito e dell’8,2% in quello rumoroso. Whisper-tiny, un piccolo modello open source di OpenAI, ha ottenuto rispettivamente il 6,3% e il 15,9% sugli stessi dati, eseguito su un laptop.

Il team ha valutato Oído anche in condizioni di rumore reali: all’interno di un’auto, in cucina e in mensa, oltre che in presenza di chiacchiericcio di fondo e riverbero. Il WER medio è stato dell’8,4%, contro il 12,1% di Whisper-tiny. Uno script per una demo dal vivo permette a chiunque di collegare il microfono di un laptop all’ESP32 e provare direttamente i calcoli sul chip.

Tutto il codice e i pesi del modello sono disponibili su GitHub con una licenza open source: appassionati e sviluppatori possono scaricarli, caricarli sulla scheda e sperimentare autonomamente il sistema.

Come si confronta con le altre soluzioni on-device?

La maggior parte dei sistemi di riconoscimento vocale on-device richiede un’unità di elaborazione neurale (NPU) dedicata o un processore più costoso. Oído dimostra che anche un normale microcontrollore con una quantità modesta di RAM può superare un modello software più grande eseguito su un laptop. Il risultato è un dispositivo piccolo ed economico, in grado di comprendere i comandi vocali senza inviare l’audio al cloud.

Perché conta

Per gli utenti comuni, significa che dispositivi economici come quelli per la smart home possono riconoscere il parlato in locale, tutelando la privacy e riducendo la dipendenza dalla connessione Internet. Gli sviluppatori possono realizzare prototipi di prodotti a controllo vocale senza hardware costoso né tariffe per le API cloud.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.