Lokutor 팀이 약 5달러짜리 ESP32-S3 마이크로컨트롤러에서 실행할 수 있는 음성 인식 모델 Oído를 공개했다. Oído는 1,300만 개 매개변수로 구성된 NVIDIA Conformer-CTC Small 모델을 int8로 양자화해 칩의 8MB RAM에 들어가도록 했다. LibriSpeech 벤치마크 테스트에서 Oído의 단어 오류율(WER)은 깨끗한 음성 데이터에서 3.7%, 잡음이 있는 데이터에서 8.2%였다. OpenAI의 소형 오픈소스 모델 Whisper-tiny는 같은 데이터를 노트북에서 처리했을 때 각각 6.3%와 15.9%를 기록했다.
팀은 자동차 실내, 주방, 구내식당 등 실제 환경의 소음에 더해 주변 대화 소리와 잔향이 있는 조건에서도 Oído를 평가했다. 평균 WER은 8.4%였고, Whisper-tiny는 12.1%였다. 라이브 데모 스크립트를 이용하면 노트북 마이크를 ESP32에 연결해 실제 칩의 연산 성능을 시험해 볼 수 있다.
코드와 모델 가중치는 모두 GitHub에 오픈소스 라이선스로 공개돼 있어, 취미 개발자와 개발자 누구나 내려받아 보드에 설치하고 직접 실험할 수 있다.
다른 온디바이스 솔루션과 비교하면?
대부분의 온디바이스 음성 인식기는 전용 신경망처리장치(NPU)나 더 비싼 프로세서가 필요하다. Oído는 메모리가 넉넉하지 않은 일반 마이크로컨트롤러도 노트북에서 실행되는 더 큰 소프트웨어 모델보다 나은 성능을 낼 수 있음을 보여준다. 그 결과, 음성을 클라우드로 전송하지 않고도 음성 명령을 알아듣는 작고 저렴한 기기가 가능해진다.
왜 중요한가
일반 사용자에게는 스마트홈 기기 같은 저렴한 제품이 음성을 기기 안에서 처리할 수 있어, 데이터를 비공개로 유지하고 인터넷 연결에 대한 의존도를 낮출 수 있다는 뜻이다. 개발자는 비싼 하드웨어나 클라우드 API 요금 없이 음성 제어 제품을 시제품으로 만들어 볼 수 있다.