Oossa

5달러 ESP32에서 음성 인식하는 Oído

Lokutor의 오픈소스 Oído 모델은 저렴한 ESP32-S3 보드에서 Whisper-tiny보다 낮은 오류율을 기록했다.

OossaOossa 게시일: 1 분 읽기

Vishnu Mohanan · Unsplash

Lokutor 팀이 약 5달러짜리 ESP32-S3 마이크로컨트롤러에서 실행할 수 있는 음성 인식 모델 Oído를 공개했다. Oído는 1,300만 개 매개변수로 구성된 NVIDIA Conformer-CTC Small 모델을 int8로 양자화해 칩의 8MB RAM에 들어가도록 했다. LibriSpeech 벤치마크 테스트에서 Oído의 단어 오류율(WER)은 깨끗한 음성 데이터에서 3.7%, 잡음이 있는 데이터에서 8.2%였다. OpenAI의 소형 오픈소스 모델 Whisper-tiny는 같은 데이터를 노트북에서 처리했을 때 각각 6.3%와 15.9%를 기록했다.

팀은 자동차 실내, 주방, 구내식당 등 실제 환경의 소음에 더해 주변 대화 소리와 잔향이 있는 조건에서도 Oído를 평가했다. 평균 WER은 8.4%였고, Whisper-tiny는 12.1%였다. 라이브 데모 스크립트를 이용하면 노트북 마이크를 ESP32에 연결해 실제 칩의 연산 성능을 시험해 볼 수 있다.

코드와 모델 가중치는 모두 GitHub에 오픈소스 라이선스로 공개돼 있어, 취미 개발자와 개발자 누구나 내려받아 보드에 설치하고 직접 실험할 수 있다.

다른 온디바이스 솔루션과 비교하면?

대부분의 온디바이스 음성 인식기는 전용 신경망처리장치(NPU)나 더 비싼 프로세서가 필요하다. Oído는 메모리가 넉넉하지 않은 일반 마이크로컨트롤러도 노트북에서 실행되는 더 큰 소프트웨어 모델보다 나은 성능을 낼 수 있음을 보여준다. 그 결과, 음성을 클라우드로 전송하지 않고도 음성 명령을 알아듣는 작고 저렴한 기기가 가능해진다.

왜 중요한가

일반 사용자에게는 스마트홈 기기 같은 저렴한 제품이 음성을 기기 안에서 처리할 수 있어, 데이터를 비공개로 유지하고 인터넷 연결에 대한 의존도를 낮출 수 있다는 뜻이다. 개발자는 비싼 하드웨어나 클라우드 API 요금 없이 음성 제어 제품을 시제품으로 만들어 볼 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.