# Qwen3 lernt mit Webvideos besser sehen – ohne Textverluste

> Ein 1,7‑Milliarden-Parameter-Sprachmodell erzielte nach dem Training mit unbearbeiteten Videoclips bessere Ergebnisse bei Bild- und Videoaufgaben, ohne bei Textaufgaben einzubüßen.

Oossa · 2026-10-09 · https://oossa.com/de/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang und seine Kolleginnen und Kollegen trainierten das Modell Qwen3‑1.7B zusätzlich mit unbeschrifteten Clips aus dem Videosatz YT‑Temporal‑1B. Nach demselben Instruction-Tuning wie beim Basismodell lag die Variante mit Video-Zwischentraining im Schnitt über vier Videobenchmarks um 2,9 Punkte und über zehn Bildbenchmarks um 5,1 Punkte vorn. Die Textleistung blieb praktisch unverändert: Im Durchschnitt erreichte das Modell 48,9 Punkte gegenüber 48,0 beim Basismodell.

## Die Fakten

- Für das Zwischentraining wurden unbearbeitete Clips aus YT‑Temporal‑1B verwendet
- Veröffentlicht am 2026‑10‑09

## Warum es wichtig ist

Das Ergebnis zeigt, dass große Sprachmodelle visuelle Fähigkeiten aus unbearbeiteten Videos lernen können – ganz ohne Bildunterschriften. Das eröffnet einen kostengünstigeren Weg zu leistungsfähigeren multimodalen KI-Systemen.

## Quellen und Referenzen

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
