Oossa

NVIDIA发布开源多模态模型 Nemotron 3 Nano Omni 30B

这款拥有300亿参数的模型目前可处理文本和图像,后续计划支持视频和音频。

作者: Oossa 发布日期: 1 分钟阅读

National Cancer Institute · Unsplash

NVIDIA发布了一款名为 Nemotron 3 Nano Omni 的新开源AI模型。它总参数量为300亿,但采用混合专家(Mixture-of-Experts)架构,因此任一时刻仅有30亿参数处于激活状态。目前,该模型可以对文本和图像进行推理。处理视频或音频输入时,必须通过一个特殊标志关闭思考模式。

模型能做什么

这是一款多模态模型,也就是说,它能够处理不止一种类型的数据。发布时,它支持文本转文本和文本转图像任务,例如回答有关图片的问题或描述图像。NVIDIA指出,技术上也可以输入视频和音频,但需要在请求中设置 `enable_thinking: false`,以避免报错。

为何重要

对于开发者和研究人员来说,Nemotron 3 Nano Omni是一款可免费使用的大规模模型,可针对需要同时理解语言和视觉信息的应用进行微调。由于300B参数中只有一部分处于激活状态,它的运行速度比完整的300B模型更快、成本也更低,有望降低开发多模态产品的成本。

为什么重要

开发者现在可以免费试用大型多模态模型,无需支付商业API费用。激活专家架构能降低算力成本,让规模较小的团队也有望开发出能够理解文字和图片的应用。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。