Oossa

NVIDIA lanza Nemotron 3 Nano Omni, un modelo multimodal abierto de 30B

El modelo de 30.000 millones de parámetros ya procesa texto e imágenes; más adelante incorporará compatibilidad con video y audio.

Por Publicado por Oossa: 1 min de lectura

National Cancer Institute · Unsplash

NVIDIA ha publicado un nuevo modelo de IA de código abierto llamado Nemotron 3 Nano Omni. Tiene 30.000 millones de parámetros en total, pero solo 3.000 millones están activos en cada momento gracias a su arquitectura Mixture-of-Experts. Actualmente, el modelo puede razonar a partir de texto e imágenes. Para procesar entradas de video o audio, hay que desactivar el modo de razonamiento con una opción especial.

Qué puede hacer el modelo

El modelo es multimodal, es decir, puede procesar más de un tipo de datos. En su lanzamiento admite tareas de texto a texto y de texto a imagen, como responder preguntas sobre una foto o describir una imagen. NVIDIA señala que técnicamente es posible introducir video y audio, pero para evitar errores hay que incluir `enable_thinking: false` en la solicitud.

Por qué importa

Para desarrolladores e investigadores, Nemotron 3 Nano Omni ofrece un modelo de gran escala disponible de forma gratuita, que se puede ajustar para aplicaciones que necesitan comprender tanto el lenguaje como las imágenes. Como solo se activa una parte de sus 30.000 millones de parámetros, funciona más rápido y cuesta menos que un modelo completo de 30.000 millones, lo que podría reducir el costo de crear productos multimodales.

Por qué importa

Los desarrolladores ya pueden experimentar con un modelo multimodal de gran escala sin pagar por una API comercial. El diseño con expertos activos reduce los costos de computación y hace más viable que equipos pequeños creen aplicaciones capaces de entender tanto palabras como imágenes.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.