Oossa

NVIDIA ने जारी किया खुला Nemotron 3 Nano Omni 30B मॉडल

30 अरब पैरामीटर वाला यह मॉडल फिलहाल टेक्स्ट और तस्वीरें समझता है; वीडियो और ऑडियो का समर्थन नियोजित है।

लेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

National Cancer Institute · Unsplash

NVIDIA ने Nemotron 3 Nano Omni नाम का नया ओपन-सोर्स AI मॉडल जारी किया है। इसमें कुल 30 अरब पैरामीटर हैं, लेकिन Mixture-of-Experts डिज़ाइन के कारण एक समय में सिर्फ 3 अरब पैरामीटर सक्रिय रहते हैं। फिलहाल यह टेक्स्ट और तस्वीरों के आधार पर तर्क कर सकता है। वीडियो या ऑडियो इनपुट के लिए एक विशेष फ्लैग के ज़रिए थिंकिंग मोड बंद करना होगा।

मॉडल क्या कर सकता है

यह एक मल्टीमॉडल मॉडल है, यानी एक से ज़्यादा तरह के डेटा को प्रोसेस कर सकता है। रिलीज़ के समय यह टेक्स्ट-टू-टेक्स्ट और टेक्स्ट-टू-इमेज कामों का समर्थन करता है, जैसे किसी तस्वीर के बारे में सवालों के जवाब देना या उसका वर्णन करना। NVIDIA के मुताबिक, तकनीकी तौर पर वीडियो और ऑडियो इनपुट भी संभव हैं, लेकिन त्रुटियों से बचने के लिए अनुरोध में `enable_thinking: false` सेट करना होगा।

यह क्यों अहम है

डेवलपर्स और शोधकर्ताओं के लिए Nemotron 3 Nano Omni एक बड़े पैमाने का ऐसा मॉडल उपलब्ध कराता है, जिसे ऐप्स की ज़रूरत के मुताबिक फाइन-ट्यून किया जा सकता है—खासकर उन ऐप्स के लिए जिन्हें भाषा और दृश्य, दोनों की समझ चाहिए। चूंकि 30 B पैरामीटर में से सिर्फ कुछ ही सक्रिय रहते हैं, इसलिए यह पूरे 30 B मॉडल से तेज़ और सस्ता चलता है। इससे मल्टीमॉडल उत्पाद बनाने की लागत कम हो सकती है।

यह क्यों मायने रखता है

डेवलपर्स अब किसी कमर्शियल API के लिए भुगतान किए बिना बड़े मल्टीमॉडल मॉडल के साथ प्रयोग कर सकते हैं। सक्रिय एक्सपर्ट वाला डिज़ाइन कंप्यूटिंग की लागत घटाता है, जिससे छोटी टीमों के लिए शब्दों और तस्वीरों, दोनों को समझने वाले ऐप बनाना संभव हो सकता है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।