# Qwen3 migliora nei test visivi grazie ai video web grezzi

> Dare in pasto a un modello linguistico da 1,7 B di parametri clip video grezze migliora i risultati nei test su immagini e video, senza compromettere le capacità testuali, secondo i ricercatori.

Oossa · 2026-10-09 · https://oossa.com/it/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang e i suoi colleghi hanno sottoposto il modello Qwen3-1.7B a un addestramento intermedio con clip senza didascalie tratte dal set di video YT-Temporal-1B. Dopo aver ricevuto lo stesso fine-tuning supervisionato da istruzioni del modello di riferimento, la versione addestrata con i video ha ottenuto in media 2.9 punti in più su quattro benchmark video e 5.1 punti in più su dieci benchmark per immagini. Le prestazioni nei test testuali sono rimaste sostanzialmente invariate: la media è stata di 48.9, contro 48.0 per il modello di riferimento.

## I fatti

- L’addestramento intermedio ha utilizzato clip grezze di YT-Temporal-1B
- Pubblicato il 2026‑10‑09

## Perché conta

Il risultato mostra che i modelli linguistici di grandi dimensioni possono acquisire capacità visive da video grezzi, senza didascalie, aprendo una strada meno costosa per migliorare l’IA multimodale.

## Fonti e riferimenti

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Ultimo aggiornamento: 2026-10-09
