Het team van Lokutor heeft Oído uitgebracht, een spraakherkenningsmodel dat kan draaien op een ESP32-S3-microcontroller van ongeveer vijf dollar. Het model is een NVIDIA Conformer-CTC Small met 13 miljoen parameters, gekwantiseerd naar int8 zodat het in de 8 MB RAM van de chip past. In tests met de LibriSpeech-benchmark behaalde Oído een woordfoutpercentage (WER) van 3,7% op de schone set en 8,2% op de set met ruis. Whisper-tiny, een klein opensourcemodel van OpenAI, kwam op dezelfde gegevens uit op respectievelijk 6,3% en 15,9% toen het op een laptop draaide.
Het team testte Oído ook onder realistische omstandigheden met achtergrondgeluid: in een auto, keuken en cafetaria, en met achtergrondgesprekken en galm. Het gemiddelde WER was 8,4%, tegenover 12,1% voor Whisper-tiny. Met een script voor een live demo kan iedereen een laptopmicrofoon aansluiten op de ESP32 en de berekeningen rechtstreeks op de chip uitproberen.
Alle code en modelgewichten zijn onder een opensourcelicentie uitgebracht op GitHub. Hobbyisten en ontwikkelaars kunnen het systeem dus zelf downloaden, op de chip installeren en ermee experimenteren.
Hoe verhoudt dit zich tot andere oplossingen op apparaten zelf?
De meeste spraakherkenningssystemen die op een apparaat draaien, hebben een speciale neural processing unit (NPU) of een duurdere processor nodig. Oído laat zien dat een gewone microcontroller met bescheiden hoeveelheid RAM toch beter kan presteren dan een groter softwaremodel op een complete laptop. Het resultaat is een klein, goedkoop apparaat dat gesproken opdrachten kan begrijpen zonder audio naar de cloud te sturen.
Waarom het ertoe doet
Voor gewone gebruikers betekent dit dat goedkope apparaten, zoals slimme gadgets voor thuis, spraak lokaal kunnen begrijpen. Zo blijven gegevens privé en zijn ze minder afhankelijk van een internetverbinding. Ontwikkelaars kunnen producten met spraakbediening ontwikkelen zonder dure hardware of kosten voor cloud-API's.