# वेब वीडियो से Qwen3 की विज़न बेंचमार्क पर बेहतर बढ़त

> शोधकर्ताओं ने पाया कि 1.7 B पैरामीटर वाले भाषा मॉडल को बिना कैप्शन के वीडियो क्लिप दिखाने से उसकी इमेज और वीडियो टास्क की स्कोरिंग बेहतर हुई, जबकि टेक्स्ट क्षमता पर असर नहीं पड़ा।

Oossa · 2026-10-09 · https://oossa.com/hi/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang और उनके सहयोगियों ने Qwen3‑1.7B मॉडल को YT‑Temporal‑1B वीडियो डेटासेट के बिना कैप्शन वाले क्लिप पर मिड-ट्रेन किया। बेसलाइन मॉडल की तरह ही इंस्ट्रक्शन ट्यूनिंग के बाद, वीडियो पर मिड-ट्रेन किए गए मॉडल ने चार वीडियो बेंचमार्क में औसतन 2.9 अंक और दस इमेज बेंचमार्क में 5.1 अंक अधिक हासिल किए। टेक्स्ट पर प्रदर्शन लगभग जस का तस रहा: बेसलाइन के 48.0 के मुकाबले औसत स्कोर 48.9 था।

## तथ्य

- मिड-ट्रेनिंग में YT‑Temporal‑1B के बिना प्रोसेस किए गए क्लिप इस्तेमाल किए गए
- प्रकाशित: 2026‑10‑09

## यह क्यों मायने रखता है

नतीजे बताते हैं कि बड़े भाषा मॉडल बिना किसी कैप्शन के भी कच्चे वीडियो से विज़ुअल कौशल सीख सकते हैं। इससे बेहतर मल्टीमॉडल AI बनाने का कम खर्चीला रास्ता खुलता है।

## स्रोत और संदर्भ

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

अंतिम अपडेट: 2026-10-09
