Oossa

Oído reconnaît la parole sur un microcontrôleur ESP32 à 5 $

Le modèle open source Oído de Lokutor affiche un taux d’erreur inférieur à celui de Whisper-tiny sur une carte ESP32-S3 bon marché.

OossaPublié par Oossa: 1 min de lecture

Vishnu Mohanan · Unsplash

L’équipe de Lokutor a lancé Oído, un modèle de reconnaissance vocale qui fonctionne sur un microcontrôleur ESP32-S3 coûtant environ 5 dollars. Le modèle NVIDIA Conformer-CTC Small compte 13 millions de paramètres et a été quantifié en int8 pour tenir dans les 8 Mo de RAM de la puce. Lors de tests sur le banc d’essai LibriSpeech, Oído a obtenu un taux d’erreur par mot (WER) de 3,7 % sur l’ensemble « clean » et de 8,2 % sur l’ensemble bruité. Whisper-tiny, un petit modèle open source d’OpenAI, a obtenu respectivement 6,3 % et 15,9 % sur les mêmes données, lorsqu’il était exécuté sur un ordinateur portable.

L’équipe a également évalué Oído dans des conditions de bruit réelles : à l’intérieur d’une voiture, dans une cuisine et une cafétéria, ainsi qu’en présence de conversations en arrière-plan et de réverbération. Le WER moyen s’est établi à 8,4 %, contre 12,1 % pour Whisper-tiny. Un script de démonstration en direct permet à chacun de relier le micro d’un ordinateur portable à l’ESP32 et de tester les calculs effectués directement par la puce.

L’ensemble du code et les poids du modèle sont publiés sous licence open source sur GitHub. Les amateurs et les développeurs peuvent ainsi télécharger le système, le flasher sur la carte et l’expérimenter eux-mêmes.

Comment se compare-t-il aux autres solutions embarquées ?

La plupart des systèmes de reconnaissance vocale embarqués nécessitent une unité de traitement neuronal (NPU) dédiée ou un processeur plus coûteux. Oído montre qu’un simple microcontrôleur doté d’une mémoire vive modeste peut tout de même faire mieux qu’un modèle logiciel plus volumineux exécuté sur un ordinateur portable. On obtient ainsi un appareil compact et peu coûteux, capable de comprendre des commandes vocales sans envoyer l’audio dans le cloud.

Pourquoi c'est important

Pour le grand public, cela signifie que des appareils bon marché, comme les objets connectés pour la maison, peuvent comprendre la parole en local, ce qui protège les données personnelles et réduit la dépendance à une connexion Internet. Les développeurs peuvent créer des prototypes de produits à commande vocale sans matériel coûteux ni frais d’API cloud.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.