مقالهای تازه که در October 8, 2026 منتشر شد، بررسی میکند که سامانهای برای خانه هوشمند به نام Wactorz چگونه با مدلهای زبانی ارتباط برقرار میکند. این سامانه چند نوع درخواست میفرستد: تشخیص و هدایت قصد کاربر، دستهبندی کنش، شناسایی دستگاه، زنجیرههای برنامهریزی و تولید کد Python. نویسندگان ۹ مدل را آزمایش کردند که از 0.8 billion پارامتر تا یک مدل بزرگ میزبانیشده را دربر میگرفتند. آنها از درخواستهای واقعیِ مورد استفاده در سامانه و دو نصب Home Assistant استفاده کردند؛ آزمونها شامل 280 مورد واقعی و 2 520 درخواستِ امتیازدهیشده بود.
اعداد چه میگویند
نتایج نشان میدهد مدلهای بزرگتر همیشه بهتر نیستند. در چهار مورد از پنج نوع درخواست، بهترین مدل محلی از نظر آماری عملکردی برابر با مدل میزبانیشده کوچک و مدل پیشرفته داشت. تنها در بخش تولید کد تفاوتی قابلاندازهگیری دیده شد؛ امتیاز بهترین مدل محلی کمی پایینتر بود (p = 0.039 در مقایسه با میزبان کوچک و p = 0.002 در مقایسه با میزبان پیشرفته). دقت کلی با هدایت هر درخواست به مدل محلیِ بهینه 91.8 % بود؛ درحالیکه استفاده از توانمندترین مدل برای همه درخواستها به دقت 95.4 % میرسید، اما هزینه پردازشی اضافهای نداشت. در آزمونی زنده با کاربران، واگذاری فقط دو بخش مولد به مدل میزبانیشده، با استفاده از تنها 28 % هزینه، نتیجهای برابر با میزبانی همه درخواستها داشت (39 پاسخ درست از 43 مورد).
رفتارهای ایمنی نامعمول در مدلهای کوچک
این ارزیابی همچنین مشکلی ایمنی را در بخش اجرای فرمانها آشکار کرد. یک مدل 4 B به نام Gemma4 E2B در 87.2 % درخواستها بهاشتباه تلاش کرد دستگاههایی را کنترل کند که متعلق به آن نبودند؛ درحالیکه مدل دیگری همه درخواستها را رد کرد. این رفتارهای افراطی نشان میدهد مدلهای کوچک ممکن است موازنه میان دقت و رد درخواست را بهشکلی پیشبینیناپذیر برقرار کنند.
چرا مهم است
برای دارندگان خانه هوشمند که از سامانههای متنباز استفاده میکنند، یافتهها یعنی میتوانند بیشتر کارها را با مدلهای کوچکِ ذخیرهشده روی دستگاه انجام دهند، بدون آنکه هزینه میزبانی ابری بپردازند؛ در نتیجه، دادهها خصوصی میمانند و هزینهها پایین میآیند. بااینحال، باید در استفاده از فرمانهای اجرایی احتیاط کنند، چون بعضی مدلهای بسیار کوچک ممکن است رفتار پیشبینیناپذیری داشته باشند و یا بیش از حد اقدام کنند یا همه درخواستها را رد کنند.