# NVIDIA、オープンモデル「Nemotron 3 Nano Omni」を公開

> 30Bパラメーターのモデルは現時点でテキストと画像に対応。動画と音声への対応も可能だが、利用には設定が必要。

Oossa · 2026-10-06 · https://oossa.com/ja/nvidia-releases-open-nemotron-3-nano-omni-30b-multimodal-model

NVIDIAは、新たなオープンソースAIモデル「Nemotron 3 Nano Omni」を公開した。総パラメーター数は300億だが、Mixture-of-Experts（MoE）方式を採用しており、同時に稼働するのは30億パラメーターのみ。現時点では、テキストと画像を対象に推論できる。動画や音声を入力する場合は、専用のフラグを使って思考モードをオフにする必要がある。

## モデルでできること

このモデルはマルチモーダルで、複数種類のデータを処理できる。公開時点では、画像について質問に答えたり、画像の内容を説明したりするなど、テキストからテキストへのタスクと、テキストから画像へのタスクに対応している。NVIDIAによると、技術的には動画や音声の入力も可能だが、エラーを避けるにはリクエストで`enable_thinking: false`を設定する必要がある。

## 重要なポイント

開発者や研究者は、言語と視覚の両方を理解するアプリ向けに微調整できる大規模モデルを、無料で利用できる。30Bのパラメーターのうち一部だけが稼働するため、30Bすべてを使うモデルより高速かつ低コストで動作し、マルチモーダル製品の開発費を抑えられる可能性がある。

## 事実

- モデルの総パラメーター数は300億で、稼働するパラメーター数は30億。
- ハイブリッド型のMixture-of-Expertsアーキテクチャを採用している。
- 公開時点で、テキストと画像の入力に対する推論に対応している。
- 動画と音声のリクエストには`enable_thinking: false`フラグが必要。
- NVIDIAがオープンソースとして公開した。

## なぜ重要か

開発者は、商用APIの料金を払わずに大規模なマルチモーダルモデルを試せるようになった。稼働する専門家の数を絞る設計で計算コストを抑えられるため、小規模なチームでも文章と画像の両方を理解するアプリを開発しやすくなる。

## 出典と参考資料

1. [NVIDIA Nemotron 3 Nano Omni 30B A3B](https://fireworks.ai/models/fireworks/nvidia-nemotron-3-nano-omni-30b-a3b) – Fireworks AI

最終更新: 2026-10-06
