Oossa

انتشار مدل چندوجهی متن‌باز Nemotron 3 Nano Omni 30B از NVIDIA

این مدل ۳۰ میلیاردپارامتری اکنون متن و تصویر را پردازش می‌کند و پشتیبانی از ویدئو و صدا نیز برای آن در نظر گرفته شده است.

نویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

National Cancer Institute · Unsplash

NVIDIA مدل هوش مصنوعی متن‌باز تازه‌ای با نام Nemotron 3 Nano Omni منتشر کرده است. این مدل در مجموع ۳۰ میلیارد پارامتر دارد، اما به‌لطف معماری ترکیبی متخصصان (Mixture-of-Experts)، در هر لحظه فقط ۳ میلیارد پارامتر آن فعال است. مدل در حال حاضر می‌تواند متن و تصویر را تحلیل کند. برای ورودی‌های ویدئویی یا صوتی باید حالت تفکر را با یک پرچم ویژه غیرفعال کنید.

مدل چه کارهایی می‌تواند انجام دهد

این مدل چندوجهی است؛ یعنی می‌تواند بیش از یک نوع داده را پردازش کند. هنگام عرضه، از کارهای متن‌به‌متن و متن‌به‌تصویر پشتیبانی می‌کند؛ برای نمونه، می‌تواند به پرسش‌هایی درباره یک عکس پاسخ دهد یا تصویری را توصیف کند. NVIDIA می‌گوید پردازش ورودی ویدئو و صدا از نظر فنی امکان‌پذیر است، اما برای جلوگیری از خطا باید در درخواست، `enable_thinking: false` را تنظیم کنید.

چرا اهمیت دارد

Nemotron 3 Nano Omni برای توسعه‌دهندگان و پژوهشگران، مدلی بزرگ و رایگان فراهم می‌کند که می‌توان آن را برای اپلیکیشن‌هایی که به درک زبان و تصویر نیاز دارند، تنظیم دقیق کرد. از آنجا که فقط بخشی از ۳۰ میلیارد پارامتر فعال است، این مدل سریع‌تر و ارزان‌تر از یک مدل کامل ۳۰ میلیاردپارامتری اجرا می‌شود و می‌تواند هزینه ساخت محصولات چندوجهی را کاهش دهد.

چرا مهم است

توسعه‌دهندگان اکنون می‌توانند بدون پرداخت هزینه API تجاری، یک مدل چندوجهی بزرگ را آزمایش کنند. معماری متخصصان فعال، هزینه محاسبات را پایین نگه می‌دارد و ساخت اپلیکیشن‌هایی را که هم متن و هم تصویر را درک می‌کنند، برای تیم‌های کوچک‌تر امکان‌پذیر می‌سازد.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.