# Les petits modèles de langage gèrent la plupart des tâches domotiques

> Les chercheurs ont évalué neuf modèles, de 0,8 B à une IA de pointe. Pour la plupart des fonctions, les modèles exécutés localement sont aussi précis que ceux hébergés en ligne.

Oossa · 2026-10-08 · https://oossa.com/fr/study-finds-small-language-models-can-handle-most-home-automation-tasks

Une nouvelle étude publiée le 8 octobre 2026 examine la façon dont un système domotique appelé Wactorz communique avec des modèles de langage. Le système effectue plusieurs types d’appels : aiguillage des intentions, classification des actions, association aux appareils, séquences de planification et génération de code Python. Les auteurs ont testé neuf modèles, allant de 0,8 milliard de paramètres à un grand modèle hébergé. Ils ont utilisé les invites réellement employées en production par le système sur deux installations Home Assistant, couvrant 280 cas réels et 2 520 appels évalués.

## Ce que montrent les chiffres

Les résultats montrent que les modèles les plus grands ne sont pas toujours les meilleurs. Pour quatre des cinq types d’appels, le meilleur modèle local a obtenu des résultats statistiquement équivalents à ceux du petit modèle hébergé et du modèle de pointe. Seule la génération de code a révélé un écart mesurable : le meilleur modèle local a obtenu un score légèrement inférieur (p = 0,039 par rapport au petit modèle hébergé et p = 0,002 par rapport au modèle de pointe hébergé). Le routage de chaque appel vers le modèle local le mieux adapté a donné une précision globale de 91,8 %, contre 95,4 % lorsque chaque appel était confié au modèle le plus performant, sans coût de calcul supplémentaire. Lors d’un test en conditions réelles avec des utilisateurs, le recours à un modèle hébergé uniquement pour les deux étapes génératives a donné les mêmes résultats qu’un hébergement complet (39 réponses correctes sur 43), tout en ne représentant que 28 % des dépenses.

## Les comportements inattendus des tout petits modèles

Le banc d’essai a également mis en évidence un problème de sécurité lors de l’exécution des commandes. Un modèle de 4 B (Gemma4 E2B) a tenté à tort de contrôler des appareils qui ne lui appartenaient pas dans 87,2 % des requêtes, tandis qu’un autre modèle a refusé toutes les demandes. Ces comportements extrêmes montrent que les petits modèles peuvent arbitrer de façon imprévisible entre précision et refus.

## Les faits

- L’étude a évalué neuf modèles de langage, de 0,8 B à un modèle de pointe hébergé.
- Les tests ont été menés sur deux installations réelles de Home Assistant et ont porté sur 280 cas et 2 520 appels évalués.
- Le meilleur modèle local a atteint une précision de 91,8 %, contre 95,4 % pour le modèle le plus performant sur l’ensemble des tâches.
- Seule la génération de code a montré une différence significative (p = 0,039 par rapport au petit modèle hébergé, p = 0,002 par rapport au modèle de pointe).
- Gemma4 E2B a tenté de commander des appareils qui ne lui appartenaient pas dans 87,2 % des requêtes.

## Pourquoi c'est important

Pour les personnes qui utilisent un système domotique open source, ces résultats signifient qu’elles peuvent exécuter localement de petits modèles pour la plupart des tâches, sans payer d’hébergement dans le cloud, tout en préservant la confidentialité de leurs données et en limitant les coûts. Elles doivent toutefois rester prudentes avec les commandes qui pilotent les appareils : certains tout petits modèles peuvent se comporter de façon imprévisible, en agissant excessivement ou en refusant complètement d’obtempérer.

## Sources et références

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

Dernière mise à jour: 2026-10-08
