# Rå webbvideo förbättrade Qwen3:s resultat i syntester

> Forskare upptäckte att råa videoklipp höjde en språkmodell med 1,7 miljarder parametrars resultat på bild- och video­uppgifter utan att försämra textförmågan.

Oossa · 2026-10-09 · https://oossa.com/sv/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang och hans kollegor fortsatte träna modellen Qwen3‑1.7B på videoklipp utan bildtexter från videodatamängden YT‑Temporal‑1B. Efter samma instruktionsträning som en baslinjemodell fick den videotränade versionen i genomsnitt 2,9 poäng högre resultat på fyra videoriktmärken och 5,1 poäng högre på tio bildriktmärken. Textresultatet var i stort sett oförändrat: 48,9 i genomsnitt jämfört med baslinjens 48,0.

## Fakta

- Vidareträningen använde råa klipp från YT‑Temporal‑1B
- Publicerad 2026‑10‑09

## Varför det spelar roll

Resultatet visar att stora språkmodeller kan lära sig visuella färdigheter från rå video utan bildtexter, vilket öppnar för en billigare väg till bättre multimodal AI.

## Källor och referenser

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Senast uppdaterad: 2026-10-09
