جیدونگ هوانگ و همکارانش مدل Qwen3-1.7B را با کلیپهای بدون زیرنویس مجموعهداده ویدیویی YT-Temporal-1B آموزش میانی دادند. پس از آنکه این مدل همان تنظیم دستوریِ مدل پایه را پشت سر گذاشت، نسخهای که آموزش میانی ویدیویی دیده بود در مجموعِ چهار معیار سنجش ویدیو، بهطور میانگین ۲.۹ امتیاز و در ده معیار سنجش تصویر ۵.۱ امتیاز بیشتر کسب کرد. عملکرد متنی تقریباً تغییری نکرد و میانگین امتیاز آن ۴۸.۹ بود، در برابر ۴۸.۰ برای مدل پایه.
چرا مهم است
این نتیجه نشان میدهد مدلهای زبانی بزرگ میتوانند بدون هیچ زیرنویسی، مهارتهای بینایی را از ویدیوهای خام یاد بگیرند و راهی کمهزینهتر برای بهبود هوش مصنوعی چندوجهی فراهم میکند.