# NVIDIA发布开源多模态模型 Nemotron 3 Nano Omni 30B

> 这款拥有300亿参数的模型目前可处理文本和图像，后续计划支持视频和音频。

Oossa · 2026-10-06 · https://oossa.com/zh/nvidia-releases-open-nemotron-3-nano-omni-30b-multimodal-model

NVIDIA发布了一款名为 Nemotron 3 Nano Omni 的新开源AI模型。它总参数量为300亿，但采用混合专家（Mixture-of-Experts）架构，因此任一时刻仅有30亿参数处于激活状态。目前，该模型可以对文本和图像进行推理。处理视频或音频输入时，必须通过一个特殊标志关闭思考模式。

## 模型能做什么

这是一款多模态模型，也就是说，它能够处理不止一种类型的数据。发布时，它支持文本转文本和文本转图像任务，例如回答有关图片的问题或描述图像。NVIDIA指出，技术上也可以输入视频和音频，但需要在请求中设置 `enable_thinking: false`，以避免报错。

## 为何重要

对于开发者和研究人员来说，Nemotron 3 Nano Omni是一款可免费使用的大规模模型，可针对需要同时理解语言和视觉信息的应用进行微调。由于300B参数中只有一部分处于激活状态，它的运行速度比完整的300B模型更快、成本也更低，有望降低开发多模态产品的成本。

## 事实

- 该模型总参数量为300亿，激活参数量为30亿。
- 它采用混合专家架构。
- 模型发布时支持对文本和图像输入进行推理。
- 处理视频和音频请求时，必须设置标志 `enable_thinking: false`。
- 该模型由 NVIDIA 以开源形式发布。

## 为什么重要

开发者现在可以免费试用大型多模态模型，无需支付商业API费用。激活专家架构能降低算力成本，让规模较小的团队也有望开发出能够理解文字和图片的应用。

## 来源与参考

1. [NVIDIA Nemotron 3 Nano Omni 30B A3B](https://fireworks.ai/models/fireworks/nvidia-nemotron-3-nano-omni-30b-a3b) – Fireworks AI

最后更新: 2026-10-06
