# Qwen3’e ham web videoları öğretildi, görsel testleri yükseldi

> Araştırmacılar, 1,7 milyar parametreli bir dil modeline ham video klipleri izleterek metin becerisini düşürmeden görüntü ve video görevlerindeki başarısını artırdı.

Oossa · 2026-10-09 · https://oossa.com/tr/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang ve çalışma arkadaşları, Qwen3-1.7B modelini YT-Temporal-1B video veri kümesindeki altyazısız kliplerle ek eğitimden geçirdi. Temel modelle aynı yönerge ince ayarından sonra, videoyla ek eğitimden geçen model dört video kıyaslama testinde ortalama 2,9 puan, on görüntü testinde ise 5,1 puan daha yüksek skor aldı. Metin performansı hemen hemen aynı kaldı: modelin ortalaması 48,9, temel modelinki 48,0 oldu.

## Gerçekler

- Ek eğitimde YT-Temporal-1B’den alınan ham klipler kullanıldı
- 2026-10-09 tarihinde yayımlandı

## Neden önemli

Sonuçlar, büyük dil modellerinin altyazı olmadan ham videolardan görsel beceriler öğrenebildiğini gösteriyor. Bu da daha düşük maliyetle daha yetenekli çok modlu yapay zekâ geliştirmenin önünü açabilir.

## Kaynaklar ve referanslar

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Son güncelleme: 2026-10-09
