Oossa

NVIDIA lança o modelo multimodal aberto Nemotron 3 Nano Omni 30B

O modelo de 30 bilhões de parâmetros já processa texto e imagens; o suporte a vídeo e áudio está previsto.

Por Publicado pelo Oossa: 1 min de leitura

National Cancer Institute · Unsplash

A NVIDIA publicou um novo modelo de IA de código aberto chamado Nemotron 3 Nano Omni. Ele tem 30 bilhões de parâmetros no total, mas apenas 3 bilhões ficam ativos a cada momento, graças a uma arquitetura Mixture-of-Experts. Atualmente, o modelo consegue raciocinar sobre textos e imagens. Para receber vídeos ou áudios, é preciso desativar o modo de raciocínio usando uma flag especial.

O que o modelo pode fazer

O modelo é multimodal, ou seja, consegue processar mais de um tipo de dado. No lançamento, oferece suporte a tarefas de texto para texto e de texto para imagem, como responder a perguntas sobre uma foto ou descrever uma imagem. A NVIDIA observa que, tecnicamente, também é possível enviar vídeos e áudios, mas é preciso definir `enable_thinking: false` na solicitação para evitar erros.

Por que isso importa

Para desenvolvedores e pesquisadores, o Nemotron 3 Nano Omni oferece um modelo de grande escala disponível gratuitamente, que pode ser ajustado para aplicativos que precisam compreender tanto linguagem quanto conteúdo visual. Como apenas uma fração dos 30 bilhões de parâmetros fica ativa, ele é mais rápido e barato de executar do que um modelo completo de 30 bilhões de parâmetros, o que pode reduzir o custo de desenvolver produtos multimodais.

Por que importa

Agora, desenvolvedores podem experimentar um modelo multimodal de grande escala sem pagar por uma API comercial. O design com especialistas ativos reduz os custos computacionais, tornando viável para equipes menores desenvolver aplicativos capazes de compreender palavras e imagens.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.