Oossa

NVIDIA lancia Nemotron 3 Nano Omni, modello multimodale aperto da 30B

Il modello da 30 miliardi di parametri gestisce già testi e immagini; il supporto a video e audio è previsto.

Di Pubblicato da Oossa: 1 min di lettura

National Cancer Institute · Unsplash

NVIDIA ha pubblicato un nuovo modello di IA open source, chiamato Nemotron 3 Nano Omni. Ha 30 miliardi di parametri complessivi, ma ne attiva solo 3 miliardi alla volta grazie all’architettura Mixture-of-Experts. Al momento il modello può ragionare su testi e immagini. Per elaborare video o audio bisogna disattivare la modalità di ragionamento con un flag specifico.

Cosa può fare il modello

Il modello è multimodale, cioè può elaborare più tipi di dati. Al lancio supporta attività da testo a testo e da testo a immagine, per esempio rispondere a domande su una foto o descrivere un’immagine. NVIDIA precisa che è tecnicamente possibile inserire video e audio, ma per evitare errori occorre impostare `enable_thinking: false` nella richiesta.

Perché è importante

Per sviluppatori e ricercatori, Nemotron 3 Nano Omni offre un modello di grandi dimensioni disponibile gratuitamente, che può essere ottimizzato per applicazioni che richiedono capacità linguistiche e di comprensione visiva. Poiché è attiva solo una parte dei 30 miliardi di parametri, il modello è più veloce ed economico di un modello completo da 30 miliardi, e potrebbe ridurre i costi di sviluppo di prodotti multimodali.

Perché conta

Gli sviluppatori possono ora sperimentare con un modello multimodale di grandi dimensioni senza pagare per un’API commerciale. L’architettura con esperti attivi riduce i costi di calcolo e rende più fattibile per i team più piccoli creare applicazioni capaci di comprendere sia parole sia immagini.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.