Oossa

NVIDIA выпустила открытую мультимодальную модель Nemotron 3 Nano Omni 30B

Модель с 30 млрд параметров уже работает с текстом и изображениями; поддержку видео и аудио планируют добавить.

Автор: Опубликовано Oossa: 1 мин чтения

National Cancer Institute · Unsplash

NVIDIA опубликовала новую ИИ-модель с открытым исходным кодом — Nemotron 3 Nano Omni. Всего в ней 30 млрд параметров, но благодаря архитектуре «смеси экспертов» (Mixture-of-Experts) одновременно задействованы только 3 млрд. Сейчас модель умеет анализировать текст и изображения. Чтобы обрабатывать видео или аудио, нужно отключить режим рассуждений с помощью специального флага.

Что умеет модель

Модель мультимодальная, то есть умеет обрабатывать данные разных типов. На момент запуска она поддерживает задачи с текстовым вводом и выводом, а также работу с изображениями — например, может ответить на вопросы о картинке или описать её. NVIDIA отмечает, что технически модель может обрабатывать видео и аудио, однако, чтобы избежать ошибок, в запросе нужно указать `enable_thinking: false`.

Почему это важно

Для разработчиков и исследователей Nemotron 3 Nano Omni — это бесплатная крупномасштабная модель, которую можно дообучить для приложений, которым нужны и понимание языка, и распознавание визуальной информации. Поскольку одновременно задействована лишь часть из 30 млрд параметров, модель работает быстрее и обходится дешевле, чем полноценная модель на 30 млрд параметров. Это может снизить стоимость разработки мультимодальных продуктов.

Почему это важно

Разработчики могут экспериментировать с крупной мультимодальной моделью, не оплачивая доступ к коммерческому API. Архитектура с активными экспертами снижает вычислительные затраты и позволяет небольшим командам создавать приложения, которые понимают и текст, и изображения.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.