NVIDIA, Nemotron 3 Nano Omni adlı yeni bir açık kaynaklı yapay zekâ modelini yayımladı. Toplam 30 milyar parametresi bulunan modelde, Uzmanlar Karması (Mixture-of-Experts) tasarımı sayesinde herhangi bir anda yalnızca 3 milyar parametre etkin oluyor. Model şu anda metin ve görseller üzerinde akıl yürütebiliyor. Video veya ses girdileri için özel bir bayrak kullanarak düşünme modunu kapatmanız gerekiyor.
Model neler yapabiliyor?
Model çok modlu; yani birden fazla veri türünü işleyebiliyor. İlk sürümünde metinden metne ve metinden görsele görevleri destekliyor. Örneğin bir görsel hakkında soruları yanıtlayabiliyor veya görseli betimleyebiliyor. NVIDIA, video ve ses girdilerinin teknik olarak mümkün olduğunu, ancak hata almamak için istekte `enable_thinking: false` ayarının yapılması gerektiğini belirtiyor.
Neden önemli?
Nemotron 3 Nano Omni, geliştiricilere ve araştırmacılara dil ve görsel anlama becerilerini bir arada gerektiren uygulamalara göre ince ayar yapabilecekleri, ücretsiz erişilebilir ve büyük ölçekli bir model sunuyor. 30 milyar parametrenin yalnızca bir bölümü etkin olduğundan model, 30 milyar parametrenin tamamını kullanan bir modele göre daha hızlı ve daha düşük maliyetle çalışıyor. Bu da çok modlu ürünler geliştirmenin maliyetini azaltabilir.
Neden önemli
Geliştiriciler artık ticari bir API için ödeme yapmadan büyük ölçekli, çok modlu bir modeli deneyebiliyor. Etkin uzman tasarımı hesaplama maliyetlerini düşürüyor ve daha küçük ekiplerin hem metinleri hem de görselleri anlayan uygulamalar geliştirmesini mümkün kılıyor.