Jaedong Hwang e i suoi colleghi hanno sottoposto il modello Qwen3-1.7B a un addestramento intermedio con clip senza didascalie tratte dal set di video YT-Temporal-1B. Dopo aver ricevuto lo stesso fine-tuning supervisionato da istruzioni del modello di riferimento, la versione addestrata con i video ha ottenuto in media 2.9 punti in più su quattro benchmark video e 5.1 punti in più su dieci benchmark per immagini. Le prestazioni nei test testuali sono rimaste sostanzialmente invariate: la media è stata di 48.9, contro 48.0 per il modello di riferimento.
Perché conta
Il risultato mostra che i modelli linguistici di grandi dimensioni possono acquisire capacità visive da video grezzi, senza didascalie, aprendo una strada meno costosa per migliorare l’IA multimodale.