Jaedong Hwang氏らは、キャプションのない動画データセット「YT-Temporal-1B」のクリップを使い、Qwen3-1.7Bモデルを追加学習させた。ベースラインモデルと同じ指示チューニングを行った後、動画で追加学習したモデルは、4つの動画ベンチマークの平均で2.9ポイント、10の画像ベンチマークで5.1ポイント高いスコアを記録した。テキスト性能はほぼ変わらず、平均スコアはベースラインの48.0に対して48.9だった。
なぜ重要か
大規模言語モデルはキャプションのない生動画から視覚能力を学べることが示された。マルチモーダルAIの性能を、より低コストで高める道が開ける。