Oossa

Qwen3 migliora nei test visivi grazie ai video web grezzi

Dare in pasto a un modello linguistico da 1,7 B di parametri clip video grezze migliora i risultati nei test su immagini e video, senza compromettere le capacità testuali, secondo i ricercatori.

BreveDi Pubblicato da Oossa: 1 min di lettura

Jaedong Hwang e i suoi colleghi hanno sottoposto il modello Qwen3-1.7B a un addestramento intermedio con clip senza didascalie tratte dal set di video YT-Temporal-1B. Dopo aver ricevuto lo stesso fine-tuning supervisionato da istruzioni del modello di riferimento, la versione addestrata con i video ha ottenuto in media 2.9 punti in più su quattro benchmark video e 5.1 punti in più su dieci benchmark per immagini. Le prestazioni nei test testuali sono rimaste sostanzialmente invariate: la media è stata di 48.9, contro 48.0 per il modello di riferimento.

Perché conta

Il risultato mostra che i modelli linguistici di grandi dimensioni possono acquisire capacità visive da video grezzi, senza didascalie, aprendo una strada meno costosa per migliorare l’IA multimodale.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.