# Исследование: малые языковые модели справляются с большинством задач умного дома

> Исследователи протестировали девять моделей — от 0.8 B до передовой ИИ-модели — и выяснили, что локальные модели решают большинство задач с точностью, сопоставимой с облачными.

Oossa · 2026-10-08 · https://oossa.com/ru/study-finds-small-language-models-can-handle-most-home-automation-tasks

В новой статье, опубликованной 8 октября 2026 года, исследуется взаимодействие системы автоматизации умного дома Wactorz с языковыми моделями. Система выполняет несколько типов запросов: определяет намерение пользователя, классифицирует действия, сопоставляет команды с устройствами, строит планы и генерирует код Python. Авторы протестировали девять моделей — от 0.8 млрд параметров до крупной облачной модели. Они использовали реальные производственные промпты системы на двух установках Home Assistant: всего 280 реальных случаев и 2 520 оцененных запросов.

## Что показывают результаты

Результаты показывают, что более крупные модели не всегда лучше. На четырех из пяти этапов лучшая локальная модель статистически не отличалась от небольшой облачной модели и передовой модели. Измеримая разница обнаружилась только при генерации кода: результат лучшей локальной модели был немного хуже (p = 0.039 по сравнению с небольшой облачной моделью и p = 0.002 — с передовой облачной моделью). Общая точность при маршрутизации каждого запроса к оптимальной локальной модели составила 91.8 % против 95.4 %, когда все запросы обрабатывала самая мощная модель, — и без дополнительных затрат на вычисления. В тесте с реальными пользователями обработка на сервере только двух генеративных этапов дала тот же результат, что и полностью облачная обработка (39 правильных ответов из 43), при этом расходы составили всего 28 %.

## Особенности безопасности малых моделей

Тестирование также выявило проблему безопасности на этапе управления устройствами. Одна модель с 4 B параметров (Gemma4 E2B) ошибочно пыталась управлять устройствами, которые ей не принадлежали, в 87.2 % запросов, тогда как другая модель отклоняла каждый запрос. Эти крайние варианты поведения показывают, что малые модели могут непредсказуемо разрешать компромисс между точностью и отказом от выполнения запроса.

## Факты

- В исследовании оценили девять языковых моделей — от 0.8 B до передовой облачной модели.
- Тестирование проводилось на двух реальных установках Home Assistant и охватило 280 случаев и 2 520 оцененных запросов.
- Лучшая локальная модель показала точность 91.8 % против 95.4 % у модели, использованной для всех запросов.
- Статистически значимая разница обнаружилась только при генерации кода (p = 0.039 по сравнению с небольшой облачной моделью, p = 0.002 — с передовой).
- Gemma4 E2B пыталась управлять чужими устройствами в 87.2 % запросов.

## Почему это важно

Для владельцев умного дома, использующих автоматизацию с открытым исходным кодом, результаты означают, что большинство задач можно выполнять с помощью небольших моделей, работающих локально, не оплачивая облачный хостинг и сохраняя конфиденциальность данных при низких затратах. Однако с командами управления устройствами стоит быть осторожными: некоторые малые модели могут вести себя непредсказуемо — чрезмерно активно управлять устройствами или полностью отказываться выполнять запросы.

## Источники и ссылки

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

Обновлено: 2026-10-08
