# 研究发现，小型语言模型也能胜任大多数家庭自动化任务

> 研究人员评估了从 0.8 B 参数模型到前沿 AI 模型在内的九款模型，发现本地模型处理大多数功能时，准确率与托管模型相近。

Oossa · 2026-10-08 · https://oossa.com/zh/study-finds-small-language-models-can-handle-most-home-automation-tasks

一篇于 2026 年 10 月 8 日发布的新论文，研究了名为 Wactorz 的家庭自动化系统如何与语言模型交互。该系统会发起多种调用，包括意图路由、动作分类、设备匹配、规划流程和生成 Python 代码。作者测试了九款模型，参数量从 0.8 billion 到大型托管模型不等。他们在两套 Home Assistant 实际部署环境中，使用系统真实运行时的提示词进行测试，涵盖 280 个真实案例和 2 520 次评分调用。

## 数据揭示了什么

结果显示，模型越大并不总是越好。在五种调用类型中的四种里，表现最佳的本地模型与小型托管模型和前沿模型的表现，在统计上没有差异。只有代码生成环节存在可测出的差距：最佳本地模型的得分略低（与小型托管模型相比，p = 0.039；与前沿托管模型相比，p = 0.002）。通过将每次调用路由到最合适的本地模型，整体准确率达到 91.8 %；相比之下，每次调用都使用能力最强的模型时，准确率为 95.4 %，但不需要额外计算成本。在一项真实用户测试中，仅将两个生成式环节交由托管模型处理，效果便与全程使用托管模型相当（43 次中答对 39 次），花费却只有后者的 28 %。

## 小型模型的安全隐患

这项基准测试还发现，设备控制环节存在一项安全问题。一款 4 B 模型（Gemma4 E2B）在 87.2 % 的请求中，错误地尝试控制自己无权控制的设备；另一款模型则拒绝了所有请求。这些极端表现说明，小型模型在准确响应与拒绝请求之间的取舍可能难以预测。

## 事实

- 这项研究评估了九款语言模型，参数量从 0.8 B 到前沿托管模型不等。
- 测试使用了两套 Home Assistant 实际部署环境，涵盖 280 个案例和 2 520 次评分调用。
- 表现最佳的本地模型准确率为 91.8 %，而每次调用均使用能力最强模型时为 95.4 %。
- 只有代码生成环节出现显著差异（与小型托管模型相比，p = 0.039；与前沿模型相比，p = 0.002）。
- Gemma4 E2B 在 87.2 % 的请求中尝试控制自己无权控制的设备。

## 为什么重要

对于使用开源自动化系统的家庭用户，这些发现意味着大多数任务可以由本地运行的小型模型处理，无需支付云端托管费用，同时也能保护隐私、降低成本。不过，用户在使用设备控制指令时仍应谨慎：有些小型模型的行为难以预测，可能会越权操作，也可能一概拒绝执行。

## 来源与参考

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

最后更新: 2026-10-08
