NVIDIA ने Nemotron 3 Nano Omni नाम का नया ओपन-सोर्स AI मॉडल जारी किया है। इसमें कुल 30 अरब पैरामीटर हैं, लेकिन Mixture-of-Experts डिज़ाइन के कारण एक समय में सिर्फ 3 अरब पैरामीटर सक्रिय रहते हैं। फिलहाल यह टेक्स्ट और तस्वीरों के आधार पर तर्क कर सकता है। वीडियो या ऑडियो इनपुट के लिए एक विशेष फ्लैग के ज़रिए थिंकिंग मोड बंद करना होगा।
मॉडल क्या कर सकता है
यह एक मल्टीमॉडल मॉडल है, यानी एक से ज़्यादा तरह के डेटा को प्रोसेस कर सकता है। रिलीज़ के समय यह टेक्स्ट-टू-टेक्स्ट और टेक्स्ट-टू-इमेज कामों का समर्थन करता है, जैसे किसी तस्वीर के बारे में सवालों के जवाब देना या उसका वर्णन करना। NVIDIA के मुताबिक, तकनीकी तौर पर वीडियो और ऑडियो इनपुट भी संभव हैं, लेकिन त्रुटियों से बचने के लिए अनुरोध में `enable_thinking: false` सेट करना होगा।
यह क्यों अहम है
डेवलपर्स और शोधकर्ताओं के लिए Nemotron 3 Nano Omni एक बड़े पैमाने का ऐसा मॉडल उपलब्ध कराता है, जिसे ऐप्स की ज़रूरत के मुताबिक फाइन-ट्यून किया जा सकता है—खासकर उन ऐप्स के लिए जिन्हें भाषा और दृश्य, दोनों की समझ चाहिए। चूंकि 30 B पैरामीटर में से सिर्फ कुछ ही सक्रिय रहते हैं, इसलिए यह पूरे 30 B मॉडल से तेज़ और सस्ता चलता है। इससे मल्टीमॉडल उत्पाद बनाने की लागत कम हो सकती है।
यह क्यों मायने रखता है
डेवलपर्स अब किसी कमर्शियल API के लिए भुगतान किए बिना बड़े मल्टीमॉडल मॉडल के साथ प्रयोग कर सकते हैं। सक्रिय एक्सपर्ट वाला डिज़ाइन कंप्यूटिंग की लागत घटाता है, जिससे छोटी टीमों के लिए शब्दों और तस्वीरों, दोनों को समझने वाले ऐप बनाना संभव हो सकता है।