# Oído erkennt Sprache auf einem 5-Dollar-ESP32

> Lokutors Open-Source-Modell Oído erzielt niedrigere Fehlerraten als Whisper-tiny und läuft auf einem günstigen ESP32-S3-Board.

Oossa · 2026-09-30 · https://oossa.com/de/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

Mit KI-Unterstützung erstellt und übersetzt. Prüfen Sie die Originalquellen unten.

Das Team von Lokutor hat Oído veröffentlicht, ein Spracherkennungsmodell, das auf einem ESP32-S3-Mikrocontroller für etwa fünf Dollar laufen kann. Das Modell basiert auf NVIDIA Conformer-CTC Small mit 13 Millionen Parametern und wurde auf int8 quantisiert, damit es in die 8 MB RAM des Chips passt. In Tests mit dem LibriSpeech-Benchmark erreichte Oído eine Wortfehlerrate (WER) von 3,7 % im sauberen und 8,2 % im verrauschten Datensatz. Whisper-tiny, ein kleines Open-Source-Modell von OpenAI, kam bei denselben Daten auf einem Laptop auf 6,3 % beziehungsweise 15,9 %.

Das Team testete Oído außerdem unter realistischen Lärmbedingungen – im Auto, in der Küche und in der Cafeteria sowie bei Hintergrundgesprächen und Hall. Die durchschnittliche WER lag bei 8,4 %, bei Whisper-tiny waren es 12,1 %. Mit einem Skript für eine Live-Demo kann jeder ein Laptop-Mikrofon mit dem ESP32 verbinden und die Berechnungen direkt auf dem Chip ausprobieren.

Der gesamte Code und die Modellgewichte stehen auf GitHub unter einer Open-Source-Lizenz bereit. Hobbyanwender und Entwickler können das System herunterladen, aufspielen und selbst damit experimentieren.

## Wie schneidet das Modell im Vergleich zu anderen On-Device-Lösungen ab?

Die meisten Spracherkennungssysteme, die direkt auf einem Gerät laufen, benötigen eine dedizierte Neural Processing Unit (NPU) oder einen teureren Prozessor. Oído zeigt, dass ein einfacher Mikrocontroller mit begrenztem Arbeitsspeicher ein größeres Softwaremodell übertreffen kann, das auf einem vollwertigen Laptop läuft. So entsteht ein kleines, günstiges Gerät, das gesprochene Befehle versteht, ohne Audiodaten in die Cloud zu senden.

## Die Fakten

- Oído nutzt ein auf int8 quantisiertes NVIDIA-Conformer-CTC-Small-Modell mit 13 Millionen Parametern.
- Das Modell läuft auf einem ESP32-S3-Board, das etwa 5 US-Dollar kostet und über 8 MB PSRAM verfügt.
- WER bei LibriSpeech, sauberer Datensatz: Oído 3,7 % gegenüber Whisper-tiny 6,3 %; verrauschter Datensatz: Oído 8,2 % gegenüber Whisper-tiny 15,9 %.
- Durchschnittliche WER im Test mit realistischem Lärm: Oído 8,4 % gegenüber Whisper-tiny 12,1 %.

## Warum es wichtig ist

Für Verbraucher bedeutet das, dass günstige Geräte wie Smart-Home-Gadgets Sprache lokal verstehen können. Das schützt die Privatsphäre und verringert die Abhängigkeit von einer Internetverbindung. Entwickler können sprachgesteuerte Produkte ohne teure Hardware oder Gebühren für Cloud-APIs entwickeln.

## Quellen und Referenzen

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

Zuletzt aktualisiert: 2026-09-30
