NVIDIA发布了一款名为 Nemotron 3 Nano Omni 的新开源AI模型。它总参数量为300亿,但采用混合专家(Mixture-of-Experts)架构,因此任一时刻仅有30亿参数处于激活状态。目前,该模型可以对文本和图像进行推理。处理视频或音频输入时,必须通过一个特殊标志关闭思考模式。
模型能做什么
这是一款多模态模型,也就是说,它能够处理不止一种类型的数据。发布时,它支持文本转文本和文本转图像任务,例如回答有关图片的问题或描述图像。NVIDIA指出,技术上也可以输入视频和音频,但需要在请求中设置 `enable_thinking: false`,以避免报错。
为何重要
对于开发者和研究人员来说,Nemotron 3 Nano Omni是一款可免费使用的大规模模型,可针对需要同时理解语言和视觉信息的应用进行微调。由于300B参数中只有一部分处于激活状态,它的运行速度比完整的300B模型更快、成本也更低,有望降低开发多模态产品的成本。
为什么重要
开发者现在可以免费试用大型多模态模型,无需支付商业API费用。激活专家架构能降低算力成本,让规模较小的团队也有望开发出能够理解文字和图片的应用。