Jaedong Hwang och hans kollegor fortsatte träna modellen Qwen3‑1.7B på videoklipp utan bildtexter från videodatamängden YT‑Temporal‑1B. Efter samma instruktionsträning som en baslinjemodell fick den videotränade versionen i genomsnitt 2,9 poäng högre resultat på fyra videoriktmärken och 5,1 poäng högre på tio bildriktmärken. Textresultatet var i stort sett oförändrat: 48,9 i genomsnitt jämfört med baslinjens 48,0.
Varför det spelar roll
Resultatet visar att stora språkmodeller kan lära sig visuella färdigheter från rå video utan bildtexter, vilket öppnar för en billigare väg till bättre multimodal AI.