Oossa

研究发现,小型语言模型也能胜任大多数家庭自动化任务

研究人员评估了从 0.8 B 参数模型到前沿 AI 模型在内的九款模型,发现本地模型处理大多数功能时,准确率与托管模型相近。

作者: Oossa 发布日期: 1 分钟阅读

Sebastian Scholz (Nuki) · Unsplash

一篇于 2026 年 10 月 8 日发布的新论文,研究了名为 Wactorz 的家庭自动化系统如何与语言模型交互。该系统会发起多种调用,包括意图路由、动作分类、设备匹配、规划流程和生成 Python 代码。作者测试了九款模型,参数量从 0.8 billion 到大型托管模型不等。他们在两套 Home Assistant 实际部署环境中,使用系统真实运行时的提示词进行测试,涵盖 280 个真实案例和 2 520 次评分调用。

数据揭示了什么

结果显示,模型越大并不总是越好。在五种调用类型中的四种里,表现最佳的本地模型与小型托管模型和前沿模型的表现,在统计上没有差异。只有代码生成环节存在可测出的差距:最佳本地模型的得分略低(与小型托管模型相比,p = 0.039;与前沿托管模型相比,p = 0.002)。通过将每次调用路由到最合适的本地模型,整体准确率达到 91.8 %;相比之下,每次调用都使用能力最强的模型时,准确率为 95.4 %,但不需要额外计算成本。在一项真实用户测试中,仅将两个生成式环节交由托管模型处理,效果便与全程使用托管模型相当(43 次中答对 39 次),花费却只有后者的 28 %。

小型模型的安全隐患

这项基准测试还发现,设备控制环节存在一项安全问题。一款 4 B 模型(Gemma4 E2B)在 87.2 % 的请求中,错误地尝试控制自己无权控制的设备;另一款模型则拒绝了所有请求。这些极端表现说明,小型模型在准确响应与拒绝请求之间的取舍可能难以预测。

为什么重要

对于使用开源自动化系统的家庭用户,这些发现意味着大多数任务可以由本地运行的小型模型处理,无需支付云端托管费用,同时也能保护隐私、降低成本。不过,用户在使用设备控制指令时仍应谨慎:有些小型模型的行为难以预测,可能会越权操作,也可能一概拒绝执行。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。