Eine am 8. Oktober 2026 veröffentlichte Studie untersucht, wie ein Hausautomationssystem namens Wactorz mit Sprachmodellen kommuniziert. Das System nutzt verschiedene Arten von Modellaufrufen: Intent-Routing, Aktionsklassifizierung, Gerätezuordnung, Planung und das Generieren von Python-Code. Die Autorinnen und Autoren testeten neun Modelle mit einer Größe von 0,8 Milliarden Parametern bis hin zu einem großen gehosteten Modell. Dafür verwendeten sie die tatsächlichen Produktions-Prompts des Systems in zwei Home-Assistant-Installationen und deckten 280 reale Fälle mit insgesamt 2 520 bewerteten Aufrufen ab.
Was die Zahlen zeigen
Die Ergebnisse zeigen, dass größere Modelle nicht immer besser sind. Bei vier der fünf Arten von Modellaufrufen war das beste lokale Modell statistisch betrachtet genauso gut wie das kleine gehostete Modell und ein Frontier-Modell. Nur bei der Codegenerierung gab es einen messbaren Unterschied: Das beste lokale Modell schnitt etwas schlechter ab (p = 0,039 gegenüber dem kleinen gehosteten Modell und p = 0,002 gegenüber dem gehosteten Frontier-Modell). Insgesamt lag die Genauigkeit bei 91,8 %, wenn jeder Aufruf an das jeweils optimale lokale Modell geleitet wurde. Wurde dagegen für alle Aufrufe das leistungsfähigste Modell genutzt, waren es 95,4 % – allerdings ohne zusätzlichen Rechenaufwand. In einem Live-Test mit Nutzenden erzielte das Hosting nur der beiden generativen Funktionen dasselbe Ergebnis wie das vollständige Hosting (39 richtige Antworten von 43) und verursachte dabei nur 28 % der Kosten.
Sicherheitsprobleme bei sehr kleinen Modellen
Der Benchmark deckte auch ein Sicherheitsproblem bei der Gerätesteuerung auf. Ein 4 B-Modell (Gemma4 E2B) versuchte in 87,2 % der Anfragen fälschlicherweise, Geräte zu steuern, für die es keine Berechtigung hatte. Ein anderes Modell lehnte jede Anfrage ab. Diese extremen Verhaltensweisen zeigen, dass kleine Modelle den Zielkonflikt zwischen Genauigkeit und Verweigerung auf unvorhersehbare Weise lösen können.
Warum es wichtig ist
Für Menschen, die Open-Source-Hausautomation nutzen, bedeutet das: Für die meisten Aufgaben können sie kleine, lokal gespeicherte Modelle einsetzen, ohne für Cloud-Hosting zu bezahlen. So bleiben Daten privat und die Kosten niedrig. Bei Steuerungsbefehlen ist jedoch Vorsicht geboten: Manche sehr kleinen Modelle können sich unvorhersehbar verhalten und entweder zu viel steuern oder sämtliche Anfragen ablehnen.