Um novo artigo, publicado em 8 de outubro de 2026, analisa como um sistema de automação residencial chamado Wactorz se comunica com modelos de linguagem. O sistema faz vários tipos de chamadas: encaminhamento de intenções, classificação de ações, identificação de dispositivos, fluxos de planejamento e geração de código Python. Os autores testaram nove modelos, de 0.8 bilhão de parâmetros a um grande modelo hospedado na nuvem. Usaram os prompts reais de produção do sistema em duas instalações do Home Assistant, abrangendo 280 casos reais e 2 520 chamadas avaliadas.
O que mostram os números
Os resultados mostram que modelos maiores nem sempre são melhores. Em quatro dos cinco pontos de chamada, o melhor modelo local teve desempenho estatisticamente igual ao do modelo pequeno hospedado na nuvem e ao de um modelo de ponta. A única diferença mensurável apareceu na geração de código: o melhor modelo local teve uma pontuação ligeiramente inferior (p = 0.039 em comparação com o modelo pequeno hospedado na nuvem e p = 0.002 em comparação com o modelo de ponta hospedado na nuvem). No geral, o encaminhamento de cada chamada para o modelo local ideal alcançou 91.8 % de precisão, ante 95.4 % quando todas as chamadas foram feitas pelo modelo mais capaz, sem custo computacional adicional. Em um teste com usuários em condições reais, hospedar na nuvem apenas os dois pontos de chamada generativos teve o mesmo resultado que hospedar tudo (39 acertos em 43), usando apenas 28 % dos gastos.
Comportamentos inesperados de modelos minúsculos
O benchmark também revelou um problema de segurança no ponto de chamada responsável pelo acionamento de dispositivos. Um modelo de 4 B (Gemma4 E2B) tentou, por engano, controlar dispositivos que não estavam sob seu controle em 87.2 % das solicitações, enquanto outro modelo recusou todas elas. Esses comportamentos extremos mostram que modelos pequenos podem lidar de forma imprevisível com o equilíbrio entre precisão e recusa.
Por que importa
Para quem usa automação de código aberto em casa, os resultados indicam que é possível executar localmente modelos pequenos na maioria das tarefas sem pagar por hospedagem na nuvem, mantendo os dados privados e os custos baixos. Ainda assim, é preciso ter cautela com comandos de acionamento: alguns modelos minúsculos podem se comportar de maneira imprevisível, acionando dispositivos em excesso ou recusando todas as solicitações.