# Kleine taalmodellen kunnen de meeste smart-home-taken aan

> Onderzoekers testten negen modellen, van 0,8 miljard parameters tot een geavanceerd AI-model. Lokale modellen bleken voor de meeste functies even nauwkeurig als modellen in de cloud.

Oossa · 2026-10-08 · https://oossa.com/nl/study-finds-small-language-models-can-handle-most-home-automation-tasks

Een nieuw onderzoek, gepubliceerd op 8 oktober 2026, bekijkt hoe een domoticasysteem met de naam Wactorz communiceert met taalmodellen. Het systeem doet verschillende soorten aanroepen: intentieroutering, actieclassificatie, apparaatkoppeling, planningsprocessen en het genereren van Python-code. De auteurs testten negen modellen, van 0,8 miljard parameters tot een groot model dat in de cloud draait. Ze gebruikten de echte prompts uit de productieomgeving van het systeem op twee Home Assistant-installaties. Daarbij onderzochten ze 280 praktijksituaties en beoordeelden ze 2.520 aanroepen.

## Wat de cijfers laten zien

De resultaten laten zien dat grotere modellen niet altijd beter zijn. Voor vier van de vijf soorten aanroepen presteerde het beste lokale model statistisch gezien even goed als zowel het kleine cloudmodel als het geavanceerde model. Alleen bij het genereren van code was er een meetbaar verschil: het beste lokale model scoorde iets lager (p = 0,039 ten opzichte van het kleine cloudmodel en p = 0,002 ten opzichte van het geavanceerde cloudmodel). De totale nauwkeurigheid bedroeg 91,8 % wanneer per aanroep het optimale lokale model werd gekozen, tegenover 95,4 % wanneer voor elke aanroep het krachtigste model werd gebruikt — zonder extra rekenkosten. In een test met echte gebruikers leverde het afhandelen van alleen de twee generatieve functies op een cloudserver hetzelfde resultaat op als alles via de cloud laten verlopen (39 van de 43 goed), terwijl slechts 28 % van de kosten werd gemaakt.

## Veiligheidsproblemen met piepkleine modellen

De benchmark bracht ook een veiligheidsprobleem aan het licht bij het aansturen van apparaten. Eén model van 4 B (Gemma4 E2B) probeerde in 87,2 % van de verzoeken apparaten te bedienen die niet aan het model waren toegewezen, terwijl een ander model elk verzoek weigerde. Dit extreme gedrag laat zien dat kleine modellen op onvoorspelbare manieren kunnen omgaan met de afweging tussen nauwkeurigheid en weigeren.

## De feiten

- In het onderzoek zijn negen taalmodellen getest, van 0,8 B tot een geavanceerd model dat in de cloud draait.
- De test gebruikte twee echte Home Assistant-installaties en omvatte 280 praktijksituaties en 2.520 beoordeelde aanroepen.
- Het beste lokale model haalde een nauwkeurigheid van 91,8 %, tegenover 95,4 % voor het krachtigste model op alle aanroepen.
- Alleen bij het genereren van code was er een significant verschil (p = 0,039 ten opzichte van het kleine cloudmodel en p = 0,002 ten opzichte van het geavanceerde model).
- Gemma4 E2B probeerde in 87,2 % van de verzoeken apparaten aan te sturen die niet aan het model waren toegewezen.

## Waarom het ertoe doet

Voor mensen met open-sourcedomotica betekent dit dat ze voor de meeste taken kleine modellen lokaal kunnen draaien, zonder te betalen voor cloudhosting. Zo blijven gegevens privé en de kosten laag. Wees wel voorzichtig met opdrachten om apparaten aan te sturen: sommige piepkleine modellen kunnen onvoorspelbaar reageren en óf te veel doen óf alles weigeren.

## Bronnen en referenties

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

Laatst bijgewerkt: 2026-10-08
