Oossa

Vídeos da web melhoram resultados visuais do Qwen3

Pesquisadores descobriram que treinar um modelo de linguagem com 1,7 bilhão de parâmetros em vídeos brutos melhora seu desempenho em tarefas de imagem e vídeo sem prejudicar as habilidades com texto.

NotaPor Publicado pelo Oossa: 1 min de leitura

Jaedong Hwang e seus colegas fizeram um treinamento intermediário do modelo Qwen3-1.7B com clipes sem legendas do conjunto de vídeos YT-Temporal-1B. Após passar pelo mesmo ajuste fino por instruções que um modelo de referência, a versão treinada com vídeos obteve uma pontuação média 2,9 pontos maior em quatro benchmarks de vídeo e 5,1 pontos maior em dez benchmarks de imagem. O desempenho em texto permaneceu praticamente inalterado: média de 48,9, contra 48,0 do modelo de referência.

Por que importa

O resultado mostra que grandes modelos de linguagem podem aprender habilidades visuais com vídeos brutos, sem legendas, abrindo caminho para melhorar a IA multimodal a um custo menor.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.