# Des vidéos Web brutes améliorent les capacités visuelles de Qwen3

> Des chercheurs ont constaté que l’entraînement intermédiaire d’un modèle de langage de 1,7 milliard de paramètres sur des vidéos brutes améliore ses résultats en image et en vidéo sans nuire à ses capacités textuelles.

Oossa · 2026-10-09 · https://oossa.com/fr/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang et ses collègues ont soumis le modèle Qwen3‑1.7B à un entraînement intermédiaire sur des vidéos sans légende issues du jeu de données vidéo YT‑Temporal‑1B. Après le même ajustement par instructions que le modèle de référence, la version entraînée sur vidéo a obtenu une moyenne supérieure de 2,9 points sur quatre benchmarks vidéo et de 5,1 points sur dix benchmarks d’image. Ses performances en texte sont restées pratiquement inchangées, avec une moyenne de 48,9, contre 48,0 pour le modèle de référence.

## Les faits

- L’entraînement intermédiaire a utilisé des vidéos brutes de YT‑Temporal‑1B
- Publié le 2026‑10‑09

## Pourquoi c'est important

Ce résultat montre que les grands modèles de langage peuvent acquérir des compétences visuelles à partir de vidéos brutes, sans légendes, ouvrant une voie moins coûteuse vers une IA multimodale plus performante.

## Sources et références

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Dernière mise à jour: 2026-10-09
