2026년 10월 8일 공개된 새 논문은 Wactorz라는 가정 자동화 시스템이 언어 모델과 어떻게 상호작용하는지 살펴봤다. 이 시스템은 의도 라우팅, 동작 분류, 기기 연결, 계획 수립 파이프라인, Python 코드 생성 등 여러 유형의 호출을 수행한다. 연구진은 매개변수 0.8 billion부터 대형 호스팅 모델까지 9개 모델을 테스트했다. Home Assistant를 실제로 운영 중인 설치 환경 2곳에서 시스템의 실제 운영 프롬프트를 사용해 280개 사례와 점수가 매겨진 호출 2 520건을 평가했다.
수치가 보여주는 것
결과는 모델이 클수록 항상 성능이 좋은 것은 아니라는 점을 보여준다. 호출 지점 5곳 중 4곳에서 가장 성능이 좋은 로컬 모델은 소형 호스팅 모델, 최첨단 모델과 통계적으로 비슷한 성능을 보였다. 측정 가능한 차이가 나타난 곳은 코드 생성뿐이었다. 가장 성능이 좋은 로컬 모델의 점수는 소형 호스팅 모델(p = 0.039), 최첨단 호스팅 모델(p = 0.002)보다 약간 낮았다. 호출마다 최적의 로컬 모델을 선택했을 때 전체 정확도는 91.8 %로, 모든 호출에 가장 성능이 뛰어난 모델을 사용했을 때의 95.4 %보다 낮았지만 추가 컴퓨팅 비용은 들지 않았다. 실제 사용자 테스트에서는 생성형 작업을 담당하는 두 지점만 호스팅 모델로 처리해도 전체 호스팅 방식과 같은 결과(43건 중 39건 정답)를 냈으며, 비용은 28 %만 들었다.
초소형 모델의 안전성 문제
벤치마크에서는 기기를 실제로 작동시키는 지점에서 안전성 문제도 드러났다. 4 B 모델인 Gemma4 E2B 하나는 87.2 %의 요청에서 자신이 소유하지 않은 기기를 제어하려 했고, 다른 모델 하나는 모든 요청을 거부했다. 이런 극단적인 행동은 소형 모델이 정확도와 거부율 사이에서 예측하기 어려운 방식으로 균형을 잡을 수 있음을 보여준다.
왜 중요한가
오픈소스 자동화를 사용하는 가정에서는 대부분의 작업에 소형 로컬 모델을 실행해 클라우드 호스팅 비용을 들이지 않고 데이터를 비공개로 유지하며 비용을 낮출 수 있다는 의미다. 다만 기기 작동 명령에는 주의해야 한다. 일부 초소형 모델은 예측하기 어려운 행동을 보여 지나치게 작동시키거나 요청을 모두 거부할 수 있다.