Oossa

NVIDIA släpper öppna multimodala modellen Nemotron 3 Nano Omni 30B

Modellen med 30 miljarder parametrar hanterar text och bilder redan nu. Stöd för video och ljud är planerat.

Av Publicerad av Oossa: 1 min läsning

National Cancer Institute · Unsplash

NVIDIA har publicerat en ny AI-modell med öppen källkod som heter Nemotron 3 Nano Omni. Den har totalt 30 miljarder parametrar, men bara 3 miljarder är aktiva åt gången tack vare en Mixture-of-Experts-arkitektur. Modellen kan resonera kring text och bilder redan nu. För att använda video- eller ljudindata måste du stänga av tänkeläget med en särskild flagga.

Vad modellen kan göra

Modellen är multimodal, vilket innebär att den kan bearbeta mer än en typ av data. Vid lanseringen stöder den uppgifter från text till text och från text till bild, till exempel att svara på frågor om en bild eller beskriva en bild. NVIDIA uppger att det rent tekniskt går att använda video- och ljudindata, men att du måste ange `enable_thinking: false` i begäran för att undvika fel.

Därför är det viktigt

För utvecklare och forskare erbjuder Nemotron 3 Nano Omni en fritt tillgänglig modell i stor skala, som kan finjusteras för appar med behov av både språkförståelse och visuell förståelse. Eftersom bara en del av de 30 miljarder parametrarna är aktiva körs den snabbare och billigare än en fullständig modell med 30 miljarder parametrar. Det kan sänka kostnaden för att utveckla multimodala produkter.

Varför det spelar roll

Utvecklare kan nu experimentera med en stor multimodal modell utan att betala för ett kommersiellt API. Arkitekturen med aktiva experter håller beräkningskostnaderna nere och gör det möjligt även för mindre team att utveckla appar som förstår både text och bilder.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.