# NVIDIA lance Nemotron 3 Nano Omni, un modèle multimodal ouvert de 30B

> Ce modèle de 30 milliards de paramètres traite déjà le texte et les images ; la prise en charge de la vidéo et de l’audio est prévue.

Oossa · 2026-10-06 · https://oossa.com/fr/nvidia-releases-open-nemotron-3-nano-omni-30b-multimodal-model

NVIDIA a publié un nouveau modèle d’IA open source baptisé Nemotron 3 Nano Omni. Il compte 30 milliards de paramètres au total, mais seulement 3 milliards sont actifs à la fois grâce à une architecture Mixture of Experts. Le modèle peut déjà raisonner à partir de textes et d’images. Pour traiter des vidéos ou des fichiers audio, il faut désactiver le mode réflexion à l’aide d’un indicateur spécial.

## Ce que le modèle peut faire

Le modèle est multimodal, c’est-à-dire qu’il peut traiter plusieurs types de données. À son lancement, il prend en charge les tâches texte-texte et texte-image, par exemple répondre à des questions sur une image ou la décrire. NVIDIA précise que le traitement de vidéos et de fichiers audio est techniquement possible, mais qu’il faut définir `enable_thinking: false` dans la requête pour éviter les erreurs.

## Pourquoi c’est important

Pour les développeurs et les chercheurs, Nemotron 3 Nano Omni est un modèle de grande taille disponible gratuitement, qui peut être affiné pour des applications nécessitant à la fois une compréhension du langage et des images. Comme seule une fraction des 30 milliards de paramètres est active, il fonctionne plus rapidement et à moindre coût qu’un modèle de 30 milliards de paramètres entièrement actif, ce qui pourrait réduire le coût de création de produits multimodaux.

## Les faits

- Le modèle compte 30 milliards de paramètres au total, dont 3 milliards actifs.
- Il repose sur une architecture hybride Mixture of Experts.
- À son lancement, il peut raisonner à partir de textes et d’images.
- Les requêtes portant sur des vidéos ou des fichiers audio nécessitent l’indicateur `enable_thinking: false`.
- NVIDIA publie le modèle en open source.

## Pourquoi c'est important

Les développeurs peuvent désormais expérimenter avec un grand modèle multimodal sans payer pour une API commerciale. L’architecture à experts actifs limite les coûts de calcul et permet à de petites équipes de créer des applications capables de comprendre à la fois les mots et les images.

## Sources et références

1. [NVIDIA Nemotron 3 Nano Omni 30B A3B](https://fireworks.ai/models/fireworks/nvidia-nemotron-3-nano-omni-30b-a3b) – Fireworks AI

Dernière mise à jour: 2026-10-06
