# NVIDIA veröffentlicht offenes multimodales Modell Nemotron 3 Nano Omni 30B

> Das Modell mit 30 Milliarden Parametern verarbeitet bereits Text und Bilder; Video- und Audio-Unterstützung ist geplant.

Oossa · 2026-10-06 · https://oossa.com/de/nvidia-releases-open-nemotron-3-nano-omni-30b-multimodal-model

NVIDIA hat ein neues Open-Source-KI-Modell namens Nemotron 3 Nano Omni veröffentlicht. Es verfügt insgesamt über 30 Milliarden Parameter, von denen dank einer Mixture-of-Experts-Architektur jeweils nur 3 Milliarden aktiv sind. Das Modell kann bereits mit Text und Bildern Schlussfolgerungen anstellen. Für Video- oder Audioeingaben muss der Denkmodus mit einem speziellen Parameter deaktiviert werden.

## Was das Modell kann

Das Modell ist multimodal, kann also mehrere Datentypen verarbeiten. Zum Start unterstützt es Aufgaben mit Text- und Bildeingaben, etwa Fragen zu einem Bild zu beantworten oder ein Bild zu beschreiben. NVIDIA weist darauf hin, dass Video- und Audioeingaben technisch möglich sind. Damit es dabei nicht zu Fehlern kommt, muss in der Anfrage jedoch `enable_thinking: false` gesetzt werden.

## Warum das wichtig ist

Für Entwickler und Forschende bietet Nemotron 3 Nano Omni ein kostenlos verfügbares Modell mit vielen Parametern, das sich für Anwendungen mit Sprach- und Bildverarbeitung weitertrainieren lässt. Da jeweils nur ein Teil der 30 Milliarden Parameter aktiv ist, läuft es schneller und günstiger als ein Modell, bei dem alle 30 Milliarden Parameter zum Einsatz kommen. Das könnte die Kosten für die Entwicklung multimodaler Produkte senken.

## Die Fakten

- Das Modell verfügt insgesamt über 30 Milliarden Parameter, davon sind 3 Milliarden aktiv.
- Es nutzt eine hybride Mixture-of-Experts-Architektur.
- Zum Start unterstützt das Modell Schlussfolgerungen auf Basis von Text- und Bildeingaben.
- Für Video- und Audioanfragen ist der Parameter `enable_thinking: false` erforderlich.
- NVIDIA veröffentlicht das Modell als Open Source.

## Warum es wichtig ist

Entwickler können jetzt mit einem großen multimodalen Modell experimentieren, ohne für eine kommerzielle API bezahlen zu müssen. Durch die Architektur mit aktivierten Experten bleiben die Rechenkosten niedriger. So können auch kleinere Teams Anwendungen entwickeln, die sowohl Wörter als auch Bilder verstehen.

## Quellen und Referenzen

1. [NVIDIA Nemotron 3 Nano Omni 30B A3B](https://fireworks.ai/models/fireworks/nvidia-nemotron-3-nano-omni-30b-a3b) – Fireworks AI

Zuletzt aktualisiert: 2026-10-06
