Oossa

تدريب Qwen3 على فيديوهات الويب يحسّن أداءه البصري

وجد الباحثون أن تزويد نموذج لغوي يضم 1.7 مليار مُعامل بمقاطع فيديو خام يحسّن درجاته في مهام الصور والفيديو، من دون التأثير في قدرته على معالجة النصوص.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

أجرى جيدونغ هوانغ وزملاؤه تدريبًا وسيطًا لنموذج Qwen3-1.7B باستخدام مقاطع غير مشروحة من مجموعة الفيديوهات YT-Temporal-1B. وبعد إخضاعه لضبط التعليمات نفسه الذي خضع له النموذج الأساسي، حقق النموذج المدرّب على الفيديو نتيجة أعلى بمقدار 2.9 نقطة في المتوسط عبر أربعة معايير لقياس أداء الفيديو، و5.1 نقاط عبر عشرة معايير للصور. وظل أداؤه في النصوص على حاله تقريبًا، بمتوسط 48.9 مقابل 48.0 للنموذج الأساسي.

لماذا يهم

تُظهر النتيجة أن النماذج اللغوية الكبيرة يمكنها اكتساب مهارات بصرية من مقاطع فيديو خام من دون أي تعليقات توضيحية، ما يفتح طريقًا أقل كلفة لتحسين الذكاء الاصطناعي متعدد الوسائط.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.