Lokutor ekibi, yaklaşık 5 dolara mal olan ESP32-S3 mikrodenetleyicide çalışabilen Oído adlı konuşma tanıma modelini yayımladı. Model, 13 milyon parametreli NVIDIA Conformer-CTC Small’ın int8’e kuantize edilmiş sürümü; bu sayede çipin 8 MB RAM’ine sığıyor. LibriSpeech kıyaslama testlerinde Oído, temiz seslerde yüzde 3,7, gürültülü seslerde yüzde 8,2 kelime hata oranına (WER) ulaştı. OpenAI’ın küçük ve açık kaynaklı modeli Whisper-tiny ise aynı verilerde bir dizüstü bilgisayarda çalıştırıldığında sırasıyla yüzde 6,3 ve yüzde 15,9 puan aldı.
Ekip, Oído’yu otomobil içi, mutfak ve kafeterya gibi gerçek yaşam gürültülerinin yanı sıra arka plan konuşmaları ve yankı koşullarında da değerlendirdi. Ortalama WER yüzde 8,4 olurken Whisper-tiny’nin oranı yüzde 12,1 olarak ölçüldü. Canlı demo betiği sayesinde isteyenler dizüstü bilgisayar mikrofonunu ESP32’ye bağlayıp çipin işlem performansını bizzat deneyebiliyor.
Tüm kodlar ve model ağırlıkları GitHub’da açık kaynak lisansıyla yayımlandı. Böylece meraklılar ve geliştiriciler sistemi indirip karta yükleyebilir ve üzerinde deneyler yapabilir.
Diğer cihaz içi çözümlerle karşılaştırıldığında nasıl?
Cihaz üzerinde çalışan konuşma tanıma sistemlerinin çoğu, özel bir sinir ağı işlem birimine (NPU) ya da daha pahalı bir işlemciye ihtiyaç duyuyor. Oído, sınırlı belleğe sahip standart bir mikrodenetleyicinin, dizüstü bilgisayarda çalışan daha büyük bir yazılım modelinden bile iyi sonuç verebildiğini gösteriyor. Sonuç, ses kayıtlarını buluta göndermeden sesli komutları anlayabilen, küçük ve düşük maliyetli bir cihaz.
Neden önemli
Bu, akıllı ev cihazları gibi uygun fiyatlı ürünlerin konuşmaları yerel olarak anlayabilmesi, verilerin gizli kalması ve internet bağlantısına duyulan ihtiyacın azalması anlamına geliyor. Geliştiriciler de pahalı donanımlara veya bulut API ücretlerine ihtiyaç duymadan sesle kontrol edilen ürünlerin prototiplerini hazırlayabilir.