نشرت NVIDIA نموذج ذكاء اصطناعي جديدًا مفتوح المصدر يحمل اسم Nemotron 3 Nano Omni. ويضم 30 مليار مُعامل إجمالًا، لكن 3 مليارات فقط تكون نشطة في أي وقت، بفضل تصميم مزيج الخبراء (Mixture-of-Experts). يستطيع النموذج حاليًا الاستدلال انطلاقًا من النصوص والصور. أما لمعالجة مدخلات الفيديو أو الصوت، فيجب إيقاف وضع التفكير باستخدام علامة خاصة.
ما الذي يستطيع النموذج فعله؟
النموذج متعدد الوسائط، أي إنه يستطيع معالجة أكثر من نوع واحد من البيانات. وعند إطلاقه، يدعم مهام تحويل النص إلى نص وتحويل النص إلى صورة، مثل الإجابة عن أسئلة حول صورة أو وصفها. وتشير NVIDIA إلى أن إدخال الفيديو والصوت ممكن تقنيًا، لكن لتجنب الأخطاء، يجب ضبط `enable_thinking: false` في الطلب.
لماذا يهم ذلك؟
يوفر Nemotron 3 Nano Omni للمطورين والباحثين نموذجًا كبيرًا متاحًا مجانًا، يمكن ضبطه بدقة لتطبيقات تتطلب فهمًا للغة والصور معًا. وبما أن جزءًا فقط من مُعاملات النموذج البالغ عددها 30 مليارًا يكون نشطًا، فهو يعمل بسرعة أكبر وبتكلفة أقل من نموذج كامل يضم 30 مليار مُعامل، ما قد يخفض تكلفة تطوير منتجات متعددة الوسائط.
لماذا يهم
بات بإمكان المطورين تجربة نموذج كبير متعدد الوسائط من دون دفع رسوم لاستخدام واجهة برمجية تجارية. ويساعد تصميم الخبراء النشطين على خفض تكاليف الحوسبة، ما يتيح لفرق أصغر تطوير تطبيقات تفهم الكلمات والصور معًا.