NVIDIA ha pubblicato un nuovo modello di IA open source, chiamato Nemotron 3 Nano Omni. Ha 30 miliardi di parametri complessivi, ma ne attiva solo 3 miliardi alla volta grazie all’architettura Mixture-of-Experts. Al momento il modello può ragionare su testi e immagini. Per elaborare video o audio bisogna disattivare la modalità di ragionamento con un flag specifico.
Cosa può fare il modello
Il modello è multimodale, cioè può elaborare più tipi di dati. Al lancio supporta attività da testo a testo e da testo a immagine, per esempio rispondere a domande su una foto o descrivere un’immagine. NVIDIA precisa che è tecnicamente possibile inserire video e audio, ma per evitare errori occorre impostare `enable_thinking: false` nella richiesta.
Perché è importante
Per sviluppatori e ricercatori, Nemotron 3 Nano Omni offre un modello di grandi dimensioni disponibile gratuitamente, che può essere ottimizzato per applicazioni che richiedono capacità linguistiche e di comprensione visiva. Poiché è attiva solo una parte dei 30 miliardi di parametri, il modello è più veloce ed economico di un modello completo da 30 miliardi, e potrebbe ridurre i costi di sviluppo di prodotti multimodali.
Perché conta
Gli sviluppatori possono ora sperimentare con un modello multimodale di grandi dimensioni senza pagare per un’API commerciale. L’architettura con esperti attivi riduce i costi di calcolo e rende più fattibile per i team più piccoli creare applicazioni capaci di comprendere sia parole sia immagini.