NVIDIA опубликовала новую ИИ-модель с открытым исходным кодом — Nemotron 3 Nano Omni. Всего в ней 30 млрд параметров, но благодаря архитектуре «смеси экспертов» (Mixture-of-Experts) одновременно задействованы только 3 млрд. Сейчас модель умеет анализировать текст и изображения. Чтобы обрабатывать видео или аудио, нужно отключить режим рассуждений с помощью специального флага.
Что умеет модель
Модель мультимодальная, то есть умеет обрабатывать данные разных типов. На момент запуска она поддерживает задачи с текстовым вводом и выводом, а также работу с изображениями — например, может ответить на вопросы о картинке или описать её. NVIDIA отмечает, что технически модель может обрабатывать видео и аудио, однако, чтобы избежать ошибок, в запросе нужно указать `enable_thinking: false`.
Почему это важно
Для разработчиков и исследователей Nemotron 3 Nano Omni — это бесплатная крупномасштабная модель, которую можно дообучить для приложений, которым нужны и понимание языка, и распознавание визуальной информации. Поскольку одновременно задействована лишь часть из 30 млрд параметров, модель работает быстрее и обходится дешевле, чем полноценная модель на 30 млрд параметров. Это может снизить стоимость разработки мультимодальных продуктов.
Почему это важно
Разработчики могут экспериментировать с крупной мультимодальной моделью, не оплачивая доступ к коммерческому API. Архитектура с активными экспертами снижает вычислительные затраты и позволяет небольшим командам создавать приложения, которые понимают и текст, и изображения.