Jaedong Hwang e seus colegas fizeram um treinamento intermediário do modelo Qwen3-1.7B com clipes sem legendas do conjunto de vídeos YT-Temporal-1B. Após passar pelo mesmo ajuste fino por instruções que um modelo de referência, a versão treinada com vídeos obteve uma pontuação média 2,9 pontos maior em quatro benchmarks de vídeo e 5,1 pontos maior em dez benchmarks de imagem. O desempenho em texto permaneceu praticamente inalterado: média de 48,9, contra 48,0 do modelo de referência.
Por que importa
O resultado mostra que grandes modelos de linguagem podem aprender habilidades visuais com vídeos brutos, sem legendas, abrindo caminho para melhorar a IA multimodal a um custo menor.