Un nuovo studio pubblicato l’8 ottobre 2026 analizza il modo in cui un sistema domotico chiamato Wactorz interagisce con i modelli linguistici. Il sistema effettua diversi tipi di chiamate: instradamento degli intenti, classificazione delle azioni, identificazione dei dispositivi, pianificazione delle procedure e generazione di codice Python. Gli autori hanno testato nove modelli, da 0,8 miliardi di parametri a un grande modello ospitato. Hanno usato i prompt effettivamente impiegati dal sistema in produzione su due installazioni di Home Assistant, esaminando 280 casi reali e valutando 2.520 chiamate.
Cosa mostrano i numeri
I risultati dimostrano che i modelli più grandi non sono sempre migliori. In quattro dei cinque punti in cui vengono effettuate le chiamate, il miglior modello locale ha ottenuto risultati statisticamente equivalenti sia al piccolo modello ospitato sia a quello all’avanguardia. Solo nella generazione di codice è emersa una differenza misurabile: il miglior modello locale ha ottenuto un punteggio leggermente inferiore (p = 0,039 rispetto al modello ospitato più piccolo e p = 0,002 rispetto a quello all’avanguardia). L’accuratezza complessiva, instradando ogni chiamata al modello locale più adatto, è stata del 91,8%, contro il 95,4% ottenuto usando per ogni chiamata il modello più capace, senza però costi aggiuntivi di calcolo. In una prova con utenti reali, affidare a un modello ospitato solo le due funzioni generative ha dato gli stessi risultati dell’uso completo di modelli ospitati (39 risposte corrette su 43), con una spesa pari ad appena il 28%.
I comportamenti imprevedibili dei modelli più piccoli
Il benchmark ha inoltre rilevato un problema di sicurezza nel controllo dei dispositivi. Un modello da 4 B (Gemma4 E2B) ha tentato per errore di controllare dispositivi che non gli appartenevano nel 87,2% delle richieste, mentre un altro modello ha rifiutato ogni richiesta. Questi comportamenti estremi mostrano che i modelli piccoli possono gestire in modo imprevedibile il compromesso tra accuratezza e rifiuto delle richieste.
Perché conta
Per chi usa sistemi domotici open source, i risultati indicano che è possibile eseguire in locale modelli di piccole dimensioni per la maggior parte delle attività, evitando i costi dell’hosting sul cloud e mantenendo bassi i costi e privati i dati. È però bene prestare attenzione ai comandi che attivano i dispositivi: alcuni modelli molto piccoli possono comportarsi in modo imprevedibile, eccedendo nelle azioni o rifiutandosi del tutto di eseguirle.