# تدريب Qwen3 على فيديوهات الويب يحسّن أداءه البصري

> وجد الباحثون أن تزويد نموذج لغوي يضم 1.7 مليار مُعامل بمقاطع فيديو خام يحسّن درجاته في مهام الصور والفيديو، من دون التأثير في قدرته على معالجة النصوص.

Oossa · 2026-10-09 · https://oossa.com/ar/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

أجرى جيدونغ هوانغ وزملاؤه تدريبًا وسيطًا لنموذج Qwen3-1.7B باستخدام مقاطع غير مشروحة من مجموعة الفيديوهات YT-Temporal-1B. وبعد إخضاعه لضبط التعليمات نفسه الذي خضع له النموذج الأساسي، حقق النموذج المدرّب على الفيديو نتيجة أعلى بمقدار 2.9 نقطة في المتوسط عبر أربعة معايير لقياس أداء الفيديو، و5.1 نقاط عبر عشرة معايير للصور. وظل أداؤه في النصوص على حاله تقريبًا، بمتوسط 48.9 مقابل 48.0 للنموذج الأساسي.

## الحقائق

- استخدم التدريب الوسيط مقاطع خامًا من YT-Temporal-1B
- نُشرت الدراسة في 2026‑10‑09

## لماذا يهم

تُظهر النتيجة أن النماذج اللغوية الكبيرة يمكنها اكتساب مهارات بصرية من مقاطع فيديو خام من دون أي تعليقات توضيحية، ما يفتح طريقًا أقل كلفة لتحسين الذكاء الاصطناعي متعدد الوسائط.

## المصادر والمراجع

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

آخر تحديث: 2026-10-09
