Oossa

Qwen3 leert van ruwe webvideo’s en scoort beter op beeldtaken

Onderzoekers ontdekten dat het trainen van een taalmodel met 1,7 miljard parameters op ruwe videoclips de scores voor beeld- en videotaken verbetert, zonder de taalvaardigheid aan te tasten.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Jaedong Hwang en collega’s trainden het Qwen3-1.7B-model verder op clips zonder bijschriften uit de videoset YT-Temporal-1B. Na dezelfde instructietraining als een basismodel scoorde de versie die met video was doorgetraind gemiddeld 2,9 punten hoger op vier videobenchmarks en 5,1 punten hoger op tien beeldbenchmarks. De prestaties op taaltaken bleven vrijwel gelijk: gemiddeld 48,9 tegenover 48,0 voor het basismodel.

Waarom het ertoe doet

Dit resultaat laat zien dat grote taalmodellen visuele vaardigheden kunnen leren van ruwe video, zonder bijschriften. Dat biedt een goedkopere route naar betere multimodale AI.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.