Oossa

Qwen3 lernt mit Webvideos besser sehen – ohne Textverluste

Ein 1,7‑Milliarden-Parameter-Sprachmodell erzielte nach dem Training mit unbearbeiteten Videoclips bessere Ergebnisse bei Bild- und Videoaufgaben, ohne bei Textaufgaben einzubüßen.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Jaedong Hwang und seine Kolleginnen und Kollegen trainierten das Modell Qwen3‑1.7B zusätzlich mit unbeschrifteten Clips aus dem Videosatz YT‑Temporal‑1B. Nach demselben Instruction-Tuning wie beim Basismodell lag die Variante mit Video-Zwischentraining im Schnitt über vier Videobenchmarks um 2,9 Punkte und über zehn Bildbenchmarks um 5,1 Punkte vorn. Die Textleistung blieb praktisch unverändert: Im Durchschnitt erreichte das Modell 48,9 Punkte gegenüber 48,0 beim Basismodell.

Warum es wichtig ist

Das Ergebnis zeigt, dass große Sprachmodelle visuelle Fähigkeiten aus unbearbeiteten Videos lernen können – ganz ohne Bildunterschriften. Das eröffnet einen kostengünstigeren Weg zu leistungsfähigeren multimodalen KI-Systemen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.