Oossa

NVIDIA brengt open Nemotron 3 Nano Omni-model van 30B uit

Het model met 30 miljard parameters verwerkt nu tekst en afbeeldingen; ondersteuning voor video en audio is gepland.

Door Gepubliceerd door Oossa: 1 min lezen

National Cancer Institute · Unsplash

NVIDIA heeft een nieuw open-source AI-model gepubliceerd: Nemotron 3 Nano Omni. Het heeft in totaal 30 miljard parameters, maar dankzij een Mixture-of-Experts-ontwerp zijn er op elk moment slechts 3 miljard actief. Het model kan nu redeneren over tekst en afbeeldingen. Voor video- of audio-invoer moet je de denkmodus uitschakelen met een speciale vlag.

Wat het model kan

Het model is multimodaal, wat betekent dat het meer dan één soort gegevens kan verwerken. Bij de lancering ondersteunt het taken van tekst naar tekst en van tekst naar afbeelding, zoals vragen beantwoorden over een foto of een afbeelding beschrijven. NVIDIA merkt op dat video- en audio-invoer technisch mogelijk zijn, maar dat je in het verzoek `enable_thinking: false` moet instellen om fouten te voorkomen.

Waarom dit belangrijk is

Voor ontwikkelaars en onderzoekers biedt Nemotron 3 Nano Omni een vrij beschikbaar model op grote schaal, dat kan worden verfijnd voor apps die zowel taal als beelden moeten begrijpen. Omdat slechts een deel van de 30 miljard parameters actief is, werkt het sneller en goedkoper dan een volledig model van 30 miljard parameters. Dat kan de kosten voor het ontwikkelen van multimodale producten verlagen.

Waarom het ertoe doet

Ontwikkelaars kunnen nu experimenteren met een groot multimodaal model zonder te betalen voor een commerciële API. Dankzij het ontwerp met actieve experts blijven de rekenkosten lager, waardoor ook kleinere teams apps kunnen ontwikkelen die zowel tekst als afbeeldingen begrijpen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.