Jaedong Hwang ve çalışma arkadaşları, Qwen3-1.7B modelini YT-Temporal-1B video veri kümesindeki altyazısız kliplerle ek eğitimden geçirdi. Temel modelle aynı yönerge ince ayarından sonra, videoyla ek eğitimden geçen model dört video kıyaslama testinde ortalama 2,9 puan, on görüntü testinde ise 5,1 puan daha yüksek skor aldı. Metin performansı hemen hemen aynı kaldı: modelin ortalaması 48,9, temel modelinki 48,0 oldu.
Neden önemli
Sonuçlar, büyük dil modellerinin altyazı olmadan ham videolardan görsel beceriler öğrenebildiğini gösteriyor. Bu da daha düşük maliyetle daha yetenekli çok modlu yapay zekâ geliştirmenin önünü açabilir.