# Araştırma: Küçük dil modelleri ev otomasyonunda çoğu işi yapabiliyor

> Araştırmacılar, 0.8 B parametreden en gelişmiş yapay zekâ modellerine uzanan dokuz modeli değerlendirdi. Yerel modellerin çoğu işlevde bulutta çalışan modellerle benzer doğruluğa ulaştığını gösterdi.

Oossa · 2026-10-08 · https://oossa.com/tr/study-finds-small-language-models-can-handle-most-home-automation-tasks

8 Ekim 2026'da yayımlanan yeni bir makale, Wactorz adlı ev otomasyon sisteminin dil modelleriyle nasıl iletişim kurduğunu inceliyor. Sistem; niyet yönlendirme, eylem sınıflandırma, cihaz eşleştirme, planlama süreçleri ve Python kodu üretme gibi çeşitli çağrılar yapıyor. Yazarlar, 0.8 milyar parametreli modellerden büyük bir bulut modeline kadar dokuz modeli test etti. Sistemin üretimde kullandığı gerçek komutları iki Home Assistant kurulumunda denediler; 280 gerçek vaka ve puanlanan 2 520 çağrı değerlendirmeye alındı.

## Rakamlar ne gösteriyor?

Sonuçlar, daha büyük modellerin her zaman daha iyi olmadığını ortaya koyuyor. Beş çağrı noktasının dördünde en iyi yerel modelin performansı, hem küçük bulut modeliyle hem de en gelişmiş modelle istatistiksel olarak aynı düzeydeydi. Ölçülebilir fark yalnızca kod üretiminde görüldü: En iyi yerel modelin puanı biraz daha düşüktü (küçük bulut modeline kıyasla p = 0.039, en gelişmiş bulut modele kıyasla p = 0.002). Her çağrıyı en uygun yerel modele yönlendirince genel doğruluk %91.8 oldu. Tüm çağrılarda en yetkin modeli kullanıldığında bu oran %95.4'e çıkarken, ek işlem maliyeti oluşmadı. Gerçek kullanıcılarla yapılan testte, yalnızca iki üretken çağrı noktasını bulut modelinde çalıştırmak, tüm sistemi buluta taşımakla aynı sonucu verdi (43 çağrının 39'u doğru); üstelik harcamanın yalnızca %28'i kullanıldı.

## Küçük modellerin güvenlik sorunları

Kıyaslama, eyleme geçirme aşamasında bir güvenlik sorununu da ortaya çıkardı. 4 B boyutundaki modellerden biri (Gemma4 E2B), isteklerin %87.2'sinde kendisine ait olmayan cihazları kontrol etmeye çalışırken başka bir model tüm istekleri reddetti. Bu uç davranışlar, küçük modellerin doğruluk ile isteği reddetme arasındaki dengeyi öngörülemez biçimde kurabildiğini gösteriyor.

## Gerçekler

- Araştırmada 0.8 B parametreli modellerden en gelişmiş bulut modeline kadar dokuz dil modeli değerlendirildi.
- Testler, 280 vakayı ve puanlanan 2 520 çağrıyı kapsayan iki gerçek Home Assistant kurulumunda yapıldı.
- En iyi yerel model %91.8 doğruluğa ulaştı; en yetkin modelin doğruluğu %95.4 oldu.
- Anlamlı fark yalnızca kod üretiminde görüldü (küçük bulut modeline kıyasla p = 0.039, en gelişmiş modele kıyasla p = 0.002).
- Gemma4 E2B, kendisine ait olmayan cihazları kontrol etmek için gelen isteklerin %87.2'sinde eyleme geçti.

## Neden önemli

Açık kaynaklı ev otomasyonu kullananlar için bu bulgular, çoğu işi bulut hizmeti için ödeme yapmadan, verileri gizli ve maliyetleri düşük tutarak yerel olarak depolanan küçük modellerle yürütebilecekleri anlamına geliyor. Ancak bazı küçük modeller öngörülemez davranıp ya gereğinden fazla eyleme geçebileceği ya da tüm istekleri reddedebileceği için cihazları kontrol eden komutlarda dikkatli olunmalı.

## Kaynaklar ve referanslar

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

Son güncelleme: 2026-10-08
