Jaedong Hwang en collega’s trainden het Qwen3-1.7B-model verder op clips zonder bijschriften uit de videoset YT-Temporal-1B. Na dezelfde instructietraining als een basismodel scoorde de versie die met video was doorgetraind gemiddeld 2,9 punten hoger op vier videobenchmarks en 5,1 punten hoger op tien beeldbenchmarks. De prestaties op taaltaken bleven vrijwel gelijk: gemiddeld 48,9 tegenover 48,0 voor het basismodel.
Waarom het ertoe doet
Dit resultaat laat zien dat grote taalmodellen visuele vaardigheden kunnen leren van ruwe video, zonder bijschriften. Dat biedt een goedkopere route naar betere multimodale AI.