# Los modelos de lenguaje pequeños pueden gestionar la mayoría de las tareas domésticas

> Un estudio comparó nueve modelos, desde 0,8 B hasta uno de frontera, y concluyó que los modelos locales ofrecen una precisión similar a los alojados para la mayoría de las funciones.

Oossa · 2026-10-08 · https://oossa.com/es/study-finds-small-language-models-can-handle-most-home-automation-tasks

Un nuevo estudio, publicado el 8 de octubre de 2026, analiza cómo un sistema de automatización del hogar llamado Wactorz se comunica con modelos de lenguaje. El sistema realiza varios tipos de llamadas: enrutamiento de intenciones, clasificación de acciones, identificación de dispositivos, planificación y generación de código Python. Los autores probaron nueve modelos, desde uno de 0,8 mil millones de parámetros hasta un modelo grande alojado. Usaron las indicaciones reales de producción del sistema en dos instalaciones de Home Assistant, con 280 casos reales y 2.520 llamadas evaluadas.

## Qué muestran los resultados

Los resultados revelan que los modelos más grandes no siempre son mejores. En cuatro de los cinco tipos de llamada, el mejor modelo local obtuvo resultados estadísticamente equivalentes a los del modelo pequeño alojado y el modelo de frontera. Solo en la generación de código se observó una diferencia medible: el mejor modelo local obtuvo una puntuación algo menor (p = 0,039 frente al modelo pequeño alojado y p = 0,002 frente al modelo de frontera alojado). La precisión general al dirigir cada llamada al modelo local óptimo fue del 91,8 %, frente al 95,4 % cuando se usó el modelo más capaz para todas las llamadas, pero sin ningún costo adicional de cómputo. En una prueba con usuarios en vivo, alojar solo los dos tipos de llamadas generativas igualó los resultados del alojamiento completo (39 aciertos de 43) y requirió apenas el 28 % del gasto.

## Comportamientos inesperados de los modelos pequeños

La evaluación también detectó un problema de seguridad en las llamadas de ejecución de acciones. Un modelo de 4 B (Gemma4 E2B) intentó controlar por error dispositivos que no le pertenecían en el 87,2 % de las solicitudes, mientras que otro modelo rechazó todas las solicitudes. Estos comportamientos extremos muestran que los modelos pequeños pueden resolver de forma impredecible el equilibrio entre precisión y rechazo.

## Los hechos

- El estudio evaluó nueve modelos de lenguaje, desde uno de 0,8 B hasta un modelo de frontera alojado.
- Las pruebas se realizaron en dos instalaciones reales de Home Assistant e incluyeron 280 casos y 2.520 llamadas evaluadas.
- El mejor modelo local alcanzó una precisión del 91,8 %, frente al 95,4 % del modelo más capaz usado en todas las llamadas.
- Solo la generación de código mostró una diferencia significativa (p = 0,039 frente al modelo pequeño alojado y p = 0,002 frente al modelo de frontera).
- Gemma4 E2B intentó ejecutar acciones en dispositivos que no le pertenecían en el 87,2 % de las solicitudes.

## Por qué importa

Para quienes usan sistemas de automatización de código abierto en casa, los resultados indican que pueden ejecutar modelos pequeños almacenados localmente para la mayoría de las tareas sin pagar por alojamiento en la nube, lo que ayuda a mantener la privacidad de los datos y reducir los costos. Sin embargo, conviene tener cuidado con los comandos que ejecutan acciones: algunos modelos muy pequeños pueden comportarse de forma impredecible y actuar de más o rechazar todas las solicitudes.

## Fuentes y referencias

1. [Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System](https://arxiv.org/abs/2610.09021) – arXiv, 2026-10-08

Última actualización: 2026-10-08
