# Vídeos da web melhoram resultados visuais do Qwen3

> Pesquisadores descobriram que treinar um modelo de linguagem com 1,7 bilhão de parâmetros em vídeos brutos melhora seu desempenho em tarefas de imagem e vídeo sem prejudicar as habilidades com texto.

Oossa · 2026-10-09 · https://oossa.com/pt/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang e seus colegas fizeram um treinamento intermediário do modelo Qwen3-1.7B com clipes sem legendas do conjunto de vídeos YT-Temporal-1B. Após passar pelo mesmo ajuste fino por instruções que um modelo de referência, a versão treinada com vídeos obteve uma pontuação média 2,9 pontos maior em quatro benchmarks de vídeo e 5,1 pontos maior em dez benchmarks de imagem. O desempenho em texto permaneceu praticamente inalterado: média de 48,9, contra 48,0 do modelo de referência.

## Os fatos

- O treinamento intermediário usou clipes brutos do YT-Temporal-1B
- Publicado em 2026-10-09

## Por que importa

O resultado mostra que grandes modelos de linguagem podem aprender habilidades visuais com vídeos brutos, sem legendas, abrindo caminho para melhorar a IA multimodal a um custo menor.

## Fontes e referências

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Última atualização: 2026-10-09
