Oossa

NVIDIA、オープンモデル「Nemotron 3 Nano Omni」を公開

30Bパラメーターのモデルは現時点でテキストと画像に対応。動画と音声への対応も可能だが、利用には設定が必要。

著者: Oossa公開日: 1 分で読める

National Cancer Institute · Unsplash

NVIDIAは、新たなオープンソースAIモデル「Nemotron 3 Nano Omni」を公開した。総パラメーター数は300億だが、Mixture-of-Experts(MoE)方式を採用しており、同時に稼働するのは30億パラメーターのみ。現時点では、テキストと画像を対象に推論できる。動画や音声を入力する場合は、専用のフラグを使って思考モードをオフにする必要がある。

モデルでできること

このモデルはマルチモーダルで、複数種類のデータを処理できる。公開時点では、画像について質問に答えたり、画像の内容を説明したりするなど、テキストからテキストへのタスクと、テキストから画像へのタスクに対応している。NVIDIAによると、技術的には動画や音声の入力も可能だが、エラーを避けるにはリクエストで`enable_thinking: false`を設定する必要がある。

重要なポイント

開発者や研究者は、言語と視覚の両方を理解するアプリ向けに微調整できる大規模モデルを、無料で利用できる。30Bのパラメーターのうち一部だけが稼働するため、30Bすべてを使うモデルより高速かつ低コストで動作し、マルチモーダル製品の開発費を抑えられる可能性がある。

なぜ重要か

開発者は、商用APIの料金を払わずに大規模なマルチモーダルモデルを試せるようになった。稼働する専門家の数を絞る設計で計算コストを抑えられるため、小規模なチームでも文章と画像の両方を理解するアプリを開発しやすくなる。

出典と参考資料

1 件の出典
  1. Fireworks AI原典を読む

Markdown

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。