أجرى جيدونغ هوانغ وزملاؤه تدريبًا وسيطًا لنموذج Qwen3-1.7B باستخدام مقاطع غير مشروحة من مجموعة الفيديوهات YT-Temporal-1B. وبعد إخضاعه لضبط التعليمات نفسه الذي خضع له النموذج الأساسي، حقق النموذج المدرّب على الفيديو نتيجة أعلى بمقدار 2.9 نقطة في المتوسط عبر أربعة معايير لقياس أداء الفيديو، و5.1 نقاط عبر عشرة معايير للصور. وظل أداؤه في النصوص على حاله تقريبًا، بمتوسط 48.9 مقابل 48.0 للنموذج الأساسي.
لماذا يهم
تُظهر النتيجة أن النماذج اللغوية الكبيرة يمكنها اكتساب مهارات بصرية من مقاطع فيديو خام من دون أي تعليقات توضيحية، ما يفتح طريقًا أقل كلفة لتحسين الذكاء الاصطناعي متعدد الوسائط.