Oossa

वेब वीडियो से Qwen3 की विज़न बेंचमार्क पर बेहतर बढ़त

शोधकर्ताओं ने पाया कि 1.7 B पैरामीटर वाले भाषा मॉडल को बिना कैप्शन के वीडियो क्लिप दिखाने से उसकी इमेज और वीडियो टास्क की स्कोरिंग बेहतर हुई, जबकि टेक्स्ट क्षमता पर असर नहीं पड़ा।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

Jaedong Hwang और उनके सहयोगियों ने Qwen3‑1.7B मॉडल को YT‑Temporal‑1B वीडियो डेटासेट के बिना कैप्शन वाले क्लिप पर मिड-ट्रेन किया। बेसलाइन मॉडल की तरह ही इंस्ट्रक्शन ट्यूनिंग के बाद, वीडियो पर मिड-ट्रेन किए गए मॉडल ने चार वीडियो बेंचमार्क में औसतन 2.9 अंक और दस इमेज बेंचमार्क में 5.1 अंक अधिक हासिल किए। टेक्स्ट पर प्रदर्शन लगभग जस का तस रहा: बेसलाइन के 48.0 के मुकाबले औसत स्कोर 48.9 था।

यह क्यों मायने रखता है

नतीजे बताते हैं कि बड़े भाषा मॉडल बिना किसी कैप्शन के भी कच्चे वीडियो से विज़ुअल कौशल सीख सकते हैं। इससे बेहतर मल्टीमॉडल AI बनाने का कम खर्चीला रास्ता खुलता है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।