# Oído reconnaît la parole sur un microcontrôleur ESP32 à 5 $

> Le modèle open source Oído de Lokutor affiche un taux d’erreur inférieur à celui de Whisper-tiny sur une carte ESP32-S3 bon marché.

Oossa · 2026-09-30 · https://oossa.com/fr/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

Créé et traduit avec l’aide de l’IA. Consultez les sources originales ci-dessous.

L’équipe de Lokutor a lancé Oído, un modèle de reconnaissance vocale qui fonctionne sur un microcontrôleur ESP32-S3 coûtant environ 5 dollars. Le modèle NVIDIA Conformer-CTC Small compte 13 millions de paramètres et a été quantifié en int8 pour tenir dans les 8 Mo de RAM de la puce. Lors de tests sur le banc d’essai LibriSpeech, Oído a obtenu un taux d’erreur par mot (WER) de 3,7 % sur l’ensemble « clean » et de 8,2 % sur l’ensemble bruité. Whisper-tiny, un petit modèle open source d’OpenAI, a obtenu respectivement 6,3 % et 15,9 % sur les mêmes données, lorsqu’il était exécuté sur un ordinateur portable.

L’équipe a également évalué Oído dans des conditions de bruit réelles : à l’intérieur d’une voiture, dans une cuisine et une cafétéria, ainsi qu’en présence de conversations en arrière-plan et de réverbération. Le WER moyen s’est établi à 8,4 %, contre 12,1 % pour Whisper-tiny. Un script de démonstration en direct permet à chacun de relier le micro d’un ordinateur portable à l’ESP32 et de tester les calculs effectués directement par la puce.

L’ensemble du code et les poids du modèle sont publiés sous licence open source sur GitHub. Les amateurs et les développeurs peuvent ainsi télécharger le système, le flasher sur la carte et l’expérimenter eux-mêmes.

## Comment se compare-t-il aux autres solutions embarquées ?

La plupart des systèmes de reconnaissance vocale embarqués nécessitent une unité de traitement neuronal (NPU) dédiée ou un processeur plus coûteux. Oído montre qu’un simple microcontrôleur doté d’une mémoire vive modeste peut tout de même faire mieux qu’un modèle logiciel plus volumineux exécuté sur un ordinateur portable. On obtient ainsi un appareil compact et peu coûteux, capable de comprendre des commandes vocales sans envoyer l’audio dans le cloud.

## Les faits

- Oído repose sur le modèle NVIDIA Conformer-CTC Small, qui compte 13 millions de paramètres et est quantifié en int8.
- Il fonctionne sur une carte ESP32-S3 qui coûte environ 5 dollars et dispose de 8 Mo de PSRAM.
- WER sur LibriSpeech, ensemble « clean » : 3,7 % pour Oído contre 6,3 % pour Whisper-tiny ; ensemble bruité : 8,2 % contre 15,9 %.
- WER moyen lors du test en conditions de bruit réelles : 8,4 % pour Oído contre 12,1 % pour Whisper-tiny.

## Pourquoi c'est important

Pour le grand public, cela signifie que des appareils bon marché, comme les objets connectés pour la maison, peuvent comprendre la parole en local, ce qui protège les données personnelles et réduit la dépendance à une connexion Internet. Les développeurs peuvent créer des prototypes de produits à commande vocale sans matériel coûteux ni frais d’API cloud.

## Sources et références

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

Dernière mise à jour: 2026-09-30
