一篇于 2026 年 10 月 8 日发布的新论文,研究了名为 Wactorz 的家庭自动化系统如何与语言模型交互。该系统会发起多种调用,包括意图路由、动作分类、设备匹配、规划流程和生成 Python 代码。作者测试了九款模型,参数量从 0.8 billion 到大型托管模型不等。他们在两套 Home Assistant 实际部署环境中,使用系统真实运行时的提示词进行测试,涵盖 280 个真实案例和 2 520 次评分调用。
数据揭示了什么
结果显示,模型越大并不总是越好。在五种调用类型中的四种里,表现最佳的本地模型与小型托管模型和前沿模型的表现,在统计上没有差异。只有代码生成环节存在可测出的差距:最佳本地模型的得分略低(与小型托管模型相比,p = 0.039;与前沿托管模型相比,p = 0.002)。通过将每次调用路由到最合适的本地模型,整体准确率达到 91.8 %;相比之下,每次调用都使用能力最强的模型时,准确率为 95.4 %,但不需要额外计算成本。在一项真实用户测试中,仅将两个生成式环节交由托管模型处理,效果便与全程使用托管模型相当(43 次中答对 39 次),花费却只有后者的 28 %。
小型模型的安全隐患
这项基准测试还发现,设备控制环节存在一项安全问题。一款 4 B 模型(Gemma4 E2B)在 87.2 % 的请求中,错误地尝试控制自己无权控制的设备;另一款模型则拒绝了所有请求。这些极端表现说明,小型模型在准确响应与拒绝请求之间的取舍可能难以预测。
为什么重要
对于使用开源自动化系统的家庭用户,这些发现意味着大多数任务可以由本地运行的小型模型处理,无需支付云端托管费用,同时也能保护隐私、降低成本。不过,用户在使用设备控制指令时仍应谨慎:有些小型模型的行为难以预测,可能会越权操作,也可能一概拒绝执行。