# 小型言語モデル、家庭の自動化タスクの大半に対応可能との研究

> 0.8 Bから最先端のAIまで9モデルを評価した結果、多くの機能でローカルモデルはホスト型モデルと同等の精度を示した。

Oossa · 2026-10-08 · https://oossa.com/ja/study-finds-small-language-models-can-handle-most-home-automation-tasks

2026年10月8日に公開された新たな論文は、Wactorzと呼ばれるホームオートメーションシステムが言語モデルとどのようにやり取りするかを検証している。このシステムは、意図の振り分け、アクションの分類、デバイスの特定、計画処理、Pythonコードの生成など、複数の種類の呼び出しを行う。著者らは、パラメーター数が0.8 billionのモデルから大規模なホスト型モデルまで、9モデルをテストした。2つのHome Assistantの実運用環境で、システムが実際に使っているプロンプトを用い、実際の280件のケースと採点対象となる2 520件の呼び出しを評価した。

## 数値が示すこと

結果からは、モデルが大きければ常に優れているわけではないことが分かった。5種類の呼び出しのうち4種類では、最良のローカルモデルは、小型のホスト型モデルおよび最先端モデルの両方と統計的に同等の性能だった。測定可能な差が見られたのはコード生成だけで、最良のローカルモデルはやや低いスコアとなった（小型ホスト型モデルとの比較でp = 0.039、最先端のホスト型モデルとの比較でp = 0.002）。呼び出しごとに最適なローカルモデルを振り分けた場合、総合精度は91.8 %で、すべての呼び出しに最も高性能なモデルを使った場合の95.4 %を下回ったものの、追加の計算コストはかからなかった。実ユーザーによるテストでは、生成系の2種類の呼び出しだけをホスト型にしても、全面的にホスト型モデルを使う場合と同じ成績（43件中39件正解）となり、支出は28 %に抑えられた。

## 小型モデルの安全性に関する注意点

ベンチマークでは、アクチュエーション（機器の作動指示）に関する安全上の問題も明らかになった。4 Bモデルの1つであるGemma4 E2Bは、87.2 %のリクエストで、自分が制御権を持たないデバイスを操作しようとした。一方、別のモデルはすべてのリクエストを拒否した。こうした極端な挙動は、小型モデルが精度と拒否のトレードオフを予測不能な形で示す可能性を物語っている。

## 事実

- この研究では、0.8 Bから最先端のホスト型モデルまで、9つの言語モデルを評価した。
- テストは2つの実際のHome Assistant環境で行い、280件のケースと採点対象となる2 520件の呼び出しを扱った。
- 最良のローカルモデルの精度は91.8 %で、最も高性能な単一モデルを使った場合の95.4 %を下回った。
- 有意な差が見られたのはコード生成のみだった（小型ホスト型モデルとの比較でp = 0.039、最先端モデルとの比較でp = 0.002）。
- Gemma4 E2Bは、自分が制御権を持たないデバイスへのリクエストの87.2 %で、操作を試みた。

## なぜ重要か

オープンソースの自動化システムを使う家庭では、多くのタスクを小型のローカルモデルで処理でき、クラウド利用料を払わずにデータのプライバシーを守り、コストを抑えられる。一方、アクチュエーションの指示には注意が必要だ。一部の小型モデルは予測不能な挙動を示し、過剰に機器を作動させたり、すべての指示を拒否したりする可能性がある。

## 出典と参考資料

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

最終更新: 2026-10-08
