Oossa

Des vidéos Web brutes améliorent les capacités visuelles de Qwen3

Des chercheurs ont constaté que l’entraînement intermédiaire d’un modèle de langage de 1,7 milliard de paramètres sur des vidéos brutes améliore ses résultats en image et en vidéo sans nuire à ses capacités textuelles.

BrèvePar Publié par Oossa: 1 min de lecture

Jaedong Hwang et ses collègues ont soumis le modèle Qwen3‑1.7B à un entraînement intermédiaire sur des vidéos sans légende issues du jeu de données vidéo YT‑Temporal‑1B. Après le même ajustement par instructions que le modèle de référence, la version entraînée sur vidéo a obtenu une moyenne supérieure de 2,9 points sur quatre benchmarks vidéo et de 5,1 points sur dix benchmarks d’image. Ses performances en texte sont restées pratiquement inchangées, avec une moyenne de 48,9, contre 48,0 pour le modèle de référence.

Pourquoi c'est important

Ce résultat montre que les grands modèles de langage peuvent acquérir des compétences visuelles à partir de vidéos brutes, sans légendes, ouvrant une voie moins coûteuse vers une IA multimodale plus performante.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.