NVIDIA heeft een nieuw open-source AI-model gepubliceerd: Nemotron 3 Nano Omni. Het heeft in totaal 30 miljard parameters, maar dankzij een Mixture-of-Experts-ontwerp zijn er op elk moment slechts 3 miljard actief. Het model kan nu redeneren over tekst en afbeeldingen. Voor video- of audio-invoer moet je de denkmodus uitschakelen met een speciale vlag.
Wat het model kan
Het model is multimodaal, wat betekent dat het meer dan één soort gegevens kan verwerken. Bij de lancering ondersteunt het taken van tekst naar tekst en van tekst naar afbeelding, zoals vragen beantwoorden over een foto of een afbeelding beschrijven. NVIDIA merkt op dat video- en audio-invoer technisch mogelijk zijn, maar dat je in het verzoek `enable_thinking: false` moet instellen om fouten te voorkomen.
Waarom dit belangrijk is
Voor ontwikkelaars en onderzoekers biedt Nemotron 3 Nano Omni een vrij beschikbaar model op grote schaal, dat kan worden verfijnd voor apps die zowel taal als beelden moeten begrijpen. Omdat slechts een deel van de 30 miljard parameters actief is, werkt het sneller en goedkoper dan een volledig model van 30 miljard parameters. Dat kan de kosten voor het ontwikkelen van multimodale producten verlagen.
Waarom het ertoe doet
Ontwikkelaars kunnen nu experimenteren met een groot multimodaal model zonder te betalen voor een commerciële API. Dankzij het ontwerp met actieve experts blijven de rekenkosten lager, waardoor ook kleinere teams apps kunnen ontwikkelen die zowel tekst als afbeeldingen begrijpen.