NVIDIA مدل هوش مصنوعی متنباز تازهای با نام Nemotron 3 Nano Omni منتشر کرده است. این مدل در مجموع ۳۰ میلیارد پارامتر دارد، اما بهلطف معماری ترکیبی متخصصان (Mixture-of-Experts)، در هر لحظه فقط ۳ میلیارد پارامتر آن فعال است. مدل در حال حاضر میتواند متن و تصویر را تحلیل کند. برای ورودیهای ویدئویی یا صوتی باید حالت تفکر را با یک پرچم ویژه غیرفعال کنید.
مدل چه کارهایی میتواند انجام دهد
این مدل چندوجهی است؛ یعنی میتواند بیش از یک نوع داده را پردازش کند. هنگام عرضه، از کارهای متنبهمتن و متنبهتصویر پشتیبانی میکند؛ برای نمونه، میتواند به پرسشهایی درباره یک عکس پاسخ دهد یا تصویری را توصیف کند. NVIDIA میگوید پردازش ورودی ویدئو و صدا از نظر فنی امکانپذیر است، اما برای جلوگیری از خطا باید در درخواست، `enable_thinking: false` را تنظیم کنید.
چرا اهمیت دارد
Nemotron 3 Nano Omni برای توسعهدهندگان و پژوهشگران، مدلی بزرگ و رایگان فراهم میکند که میتوان آن را برای اپلیکیشنهایی که به درک زبان و تصویر نیاز دارند، تنظیم دقیق کرد. از آنجا که فقط بخشی از ۳۰ میلیارد پارامتر فعال است، این مدل سریعتر و ارزانتر از یک مدل کامل ۳۰ میلیاردپارامتری اجرا میشود و میتواند هزینه ساخت محصولات چندوجهی را کاهش دهد.
چرا مهم است
توسعهدهندگان اکنون میتوانند بدون پرداخت هزینه API تجاری، یک مدل چندوجهی بزرگ را آزمایش کنند. معماری متخصصان فعال، هزینه محاسبات را پایین نگه میدارد و ساخت اپلیکیشنهایی را که هم متن و هم تصویر را درک میکنند، برای تیمهای کوچکتر امکانپذیر میسازد.