Oossa

Rå webbvideo förbättrade Qwen3:s resultat i syntester

Forskare upptäckte att råa videoklipp höjde en språkmodell med 1,7 miljarder parametrars resultat på bild- och video­uppgifter utan att försämra textförmågan.

NotisAv Publicerad av Oossa: 1 min läsning

Jaedong Hwang och hans kollegor fortsatte träna modellen Qwen3‑1.7B på videoklipp utan bildtexter från videodatamängden YT‑Temporal‑1B. Efter samma instruktionsträning som en baslinjemodell fick den videotränade versionen i genomsnitt 2,9 poäng högre resultat på fyra videoriktmärken och 5,1 poäng högre på tio bildriktmärken. Textresultatet var i stort sett oförändrat: 48,9 i genomsnitt jämfört med baslinjens 48,0.

Varför det spelar roll

Resultatet visar att stora språkmodeller kan lära sig visuella färdigheter från rå video utan bildtexter, vilket öppnar för en billigare väg till bättre multimodal AI.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.