Teamet på Lokutor har släppt Oído, en taligenkänningsmodell som kan köras på en ESP32-S3-mikrokontroller för omkring 5 dollar. Modellen är en NVIDIA Conformer-CTC Small med 13 miljoner parametrar, kvantiserad till int8 för att få plats i kretsens 8 MB RAM. I tester på jämförelsetestet LibriSpeech hade Oído en ordelfrekvens (WER) på 3,7 procent för den rena ljuduppsättningen och 8,2 procent för den brusiga. Whisper-tiny, en liten modell med öppen källkod från OpenAI, fick 6,3 respektive 15,9 procent på samma data när den kördes på en bärbar dator.
Teamet utvärderade också Oído under verkliga bullerförhållanden – i en bilkupé, ett kök och en kafeteria, samt med bakgrundssorl och efterklang. Den genomsnittliga WER-frekvensen var 8,4 procent, jämfört med 12,1 procent för Whisper-tiny. Med ett skript för en livedemonstration kan vem som helst ansluta en mikrofon till sin bärbara dator, koppla den till ESP32-kortet och testa beräkningarna direkt på kretsen.
All kod och modellvikter har släppts på GitHub under en licens för öppen källkod. Därmed kan hobbyanvändare och utvecklare själva ladda ner systemet, installera det på kortet och experimentera med det.
Hur står sig modellen mot andra lösningar på enheten?
De flesta taligenkännare som körs på enheten kräver en särskild processor för neurala nätverk (NPU) eller en dyrare processor. Oído visar att en enkel mikrokontroller med begränsat arbetsminne ändå kan prestera bättre än en större programvarumodell som körs på en hel bärbar dator. Resultatet är en liten och billig enhet som kan förstå talade kommandon utan att skicka ljudet till molnet.
Varför det spelar roll
För vanliga användare innebär det att billiga enheter, som smarta hemprodukter, kan förstå tal lokalt. Det skyddar privatlivet och minskar beroendet av internetuppkopplingar. Utvecklare kan ta fram prototyper av röststyrda produkter utan dyr hårdvara eller avgifter för moln-API:er.