# 5달러 ESP32에서 음성 인식하는 Oído

> Lokutor의 오픈소스 Oído 모델은 저렴한 ESP32-S3 보드에서 Whisper-tiny보다 낮은 오류율을 기록했다.

Oossa · 2026-09-30 · https://oossa.com/ko/oido-runs-speech-recognition-on-a-5-esp32-microcontroller

AI의 도움으로 작성하고 번역했습니다. 아래 원본 출처를 확인하세요.

Lokutor 팀이 약 5달러짜리 ESP32-S3 마이크로컨트롤러에서 실행할 수 있는 음성 인식 모델 Oído를 공개했다. Oído는 1,300만 개 매개변수로 구성된 NVIDIA Conformer-CTC Small 모델을 int8로 양자화해 칩의 8MB RAM에 들어가도록 했다. LibriSpeech 벤치마크 테스트에서 Oído의 단어 오류율(WER)은 깨끗한 음성 데이터에서 3.7%, 잡음이 있는 데이터에서 8.2%였다. OpenAI의 소형 오픈소스 모델 Whisper-tiny는 같은 데이터를 노트북에서 처리했을 때 각각 6.3%와 15.9%를 기록했다.

팀은 자동차 실내, 주방, 구내식당 등 실제 환경의 소음에 더해 주변 대화 소리와 잔향이 있는 조건에서도 Oído를 평가했다. 평균 WER은 8.4%였고, Whisper-tiny는 12.1%였다. 라이브 데모 스크립트를 이용하면 노트북 마이크를 ESP32에 연결해 실제 칩의 연산 성능을 시험해 볼 수 있다.

코드와 모델 가중치는 모두 GitHub에 오픈소스 라이선스로 공개돼 있어, 취미 개발자와 개발자 누구나 내려받아 보드에 설치하고 직접 실험할 수 있다.

## 다른 온디바이스 솔루션과 비교하면?

대부분의 온디바이스 음성 인식기는 전용 신경망처리장치(NPU)나 더 비싼 프로세서가 필요하다. Oído는 메모리가 넉넉하지 않은 일반 마이크로컨트롤러도 노트북에서 실행되는 더 큰 소프트웨어 모델보다 나은 성능을 낼 수 있음을 보여준다. 그 결과, 음성을 클라우드로 전송하지 않고도 음성 명령을 알아듣는 작고 저렴한 기기가 가능해진다.

## 팩트

- Oído는 1,300만 개 매개변수의 NVIDIA Conformer-CTC Small 모델을 int8로 양자화해 사용한다.
- 약 5달러에 판매되는 8MB PSRAM 탑재 ESP32-S3 보드에서 실행된다.
- LibriSpeech 깨끗한 음성 데이터 WER: Oído 3.7%, Whisper-tiny 6.3%; 잡음 데이터 WER: Oído 8.2%, Whisper-tiny 15.9%.
- 실제 환경 소음 테스트 평균 WER: Oído 8.4%, Whisper-tiny 12.1%.

## 왜 중요한가

일반 사용자에게는 스마트홈 기기 같은 저렴한 제품이 음성을 기기 안에서 처리할 수 있어, 데이터를 비공개로 유지하고 인터넷 연결에 대한 의존도를 낮출 수 있다는 뜻이다. 개발자는 비싼 하드웨어나 클라우드 API 요금 없이 음성 제어 제품을 시제품으로 만들어 볼 수 있다.

## 출처 및 참고 자료

1. [Oído: speech recognition that beats Whisper-tiny, running on a $5 microcontroller (open source)](https://www.reddit.com/r/LocalLLaMA/comments/1wu2jjy/oído_speech_recognition_that_beats_whispertiny/) – Reddit r/LocalLLaMA, 2026-09-30

최종 업데이트: 2026-09-30
