Jaedong Hwang et ses collègues ont soumis le modèle Qwen3‑1.7B à un entraînement intermédiaire sur des vidéos sans légende issues du jeu de données vidéo YT‑Temporal‑1B. Après le même ajustement par instructions que le modèle de référence, la version entraînée sur vidéo a obtenu une moyenne supérieure de 2,9 points sur quatre benchmarks vidéo et de 5,1 points sur dix benchmarks d’image. Ses performances en texte sont restées pratiquement inchangées, avec une moyenne de 48,9, contre 48,0 pour le modèle de référence.
Pourquoi c'est important
Ce résultat montre que les grands modèles de langage peuvent acquérir des compétences visuelles à partir de vidéos brutes, sans légendes, ouvrant une voie moins coûteuse vers une IA multimodale plus performante.