# Qwen3 leert van ruwe webvideo’s en scoort beter op beeldtaken

> Onderzoekers ontdekten dat het trainen van een taalmodel met 1,7 miljard parameters op ruwe videoclips de scores voor beeld- en videotaken verbetert, zonder de taalvaardigheid aan te tasten.

Oossa · 2026-10-09 · https://oossa.com/nl/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang en collega’s trainden het Qwen3-1.7B-model verder op clips zonder bijschriften uit de videoset YT-Temporal-1B. Na dezelfde instructietraining als een basismodel scoorde de versie die met video was doorgetraind gemiddeld 2,9 punten hoger op vier videobenchmarks en 5,1 punten hoger op tien beeldbenchmarks. De prestaties op taaltaken bleven vrijwel gelijk: gemiddeld 48,9 tegenover 48,0 voor het basismodel.

## De feiten

- Voor de verdere training werden ruwe clips uit YT-Temporal-1B gebruikt
- Gepubliceerd op 2026-10-09

## Waarom het ertoe doet

Dit resultaat laat zien dat grote taalmodellen visuele vaardigheden kunnen leren van ruwe video, zonder bijschriften. Dat biedt een goedkopere route naar betere multimodale AI.

## Bronnen en referenties

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Laatst bijgewerkt: 2026-10-09
