# آموزش میانی Qwen3 با ویدیوهای خام وب، امتیازهای بینایی را بالا برد

> پژوهشگران دریافتند که آموزش یک مدل زبانی ۱.۷ میلیاردپارامتری با کلیپ‌های ویدیویی خام، امتیاز آن را در وظایف تصویری و ویدیویی بهبود می‌دهد، بی‌آنکه توانایی‌اش در متن افت کند.

Oossa · 2026-10-09 · https://oossa.com/fa/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

جیدونگ هوانگ و همکارانش مدل Qwen3-1.7B را با کلیپ‌های بدون زیرنویس مجموعه‌داده ویدیویی YT-Temporal-1B آموزش میانی دادند. پس از آنکه این مدل همان تنظیم دستوریِ مدل پایه را پشت سر گذاشت، نسخه‌ای که آموزش میانی ویدیویی دیده بود در مجموعِ چهار معیار سنجش ویدیو، به‌طور میانگین ۲.۹ امتیاز و در ده معیار سنجش تصویر ۵.۱ امتیاز بیشتر کسب کرد. عملکرد متنی تقریباً تغییری نکرد و میانگین امتیاز آن ۴۸.۹ بود، در برابر ۴۸.۰ برای مدل پایه.

## حقایق

- آموزش میانی با کلیپ‌های خام مجموعه‌داده YT-Temporal-1B انجام شد
- منتشرشده در 2026‑10‑09

## چرا مهم است

این نتیجه نشان می‌دهد مدل‌های زبانی بزرگ می‌توانند بدون هیچ زیرنویسی، مهارت‌های بینایی را از ویدیوهای خام یاد بگیرند و راهی کم‌هزینه‌تر برای بهبود هوش مصنوعی چندوجهی فراهم می‌کند.

## منابع و ارجاع‌ها

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
