Jaedong Hwang und seine Kolleginnen und Kollegen trainierten das Modell Qwen3‑1.7B zusätzlich mit unbeschrifteten Clips aus dem Videosatz YT‑Temporal‑1B. Nach demselben Instruction-Tuning wie beim Basismodell lag die Variante mit Video-Zwischentraining im Schnitt über vier Videobenchmarks um 2,9 Punkte und über zehn Bildbenchmarks um 5,1 Punkte vorn. Die Textleistung blieb praktisch unverändert: Im Durchschnitt erreichte das Modell 48,9 Punkte gegenüber 48,0 beim Basismodell.
Warum es wichtig ist
Das Ergebnis zeigt, dass große Sprachmodelle visuelle Fähigkeiten aus unbearbeiteten Videos lernen können – ganz ohne Bildunterschriften. Das eröffnet einen kostengünstigeren Weg zu leistungsfähigeren multimodalen KI-Systemen.