Jaedong Hwang और उनके सहयोगियों ने Qwen3‑1.7B मॉडल को YT‑Temporal‑1B वीडियो डेटासेट के बिना कैप्शन वाले क्लिप पर मिड-ट्रेन किया। बेसलाइन मॉडल की तरह ही इंस्ट्रक्शन ट्यूनिंग के बाद, वीडियो पर मिड-ट्रेन किए गए मॉडल ने चार वीडियो बेंचमार्क में औसतन 2.9 अंक और दस इमेज बेंचमार्क में 5.1 अंक अधिक हासिल किए। टेक्स्ट पर प्रदर्शन लगभग जस का तस रहा: बेसलाइन के 48.0 के मुकाबले औसत स्कोर 48.9 था।
यह क्यों मायने रखता है
नतीजे बताते हैं कि बड़े भाषा मॉडल बिना किसी कैप्शन के भी कच्चे वीडियो से विज़ुअल कौशल सीख सकते हैं। इससे बेहतर मल्टीमॉडल AI बनाने का कम खर्चीला रास्ता खुलता है।