# 웹 영상으로 추가 학습한 Qwen3, 비전 벤치마크 성적 향상

> 연구진은 17억 개 파라미터를 가진 언어 모델에 가공하지 않은 영상 클립을 학습시켜, 텍스트 능력은 유지하면서 이미지·영상 과제 점수를 높였다.

Oossa · 2026-10-09 · https://oossa.com/ko/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang과 동료 연구진은 캡션이 없는 YT-Temporal-1B 동영상 세트의 클립으로 Qwen3-1.7B 모델을 추가 학습했다. 기준 모델과 동일한 지시 튜닝을 거친 뒤 평가한 결과, 영상 추가 학습 모델은 4개 영상 벤치마크에서 평균 2.9점, 10개 이미지 벤치마크에서 평균 5.1점 더 높은 점수를 기록했다. 텍스트 성능은 사실상 변하지 않아 평균 점수는 48.9점으로, 기준 모델의 48.0점과 비슷했다.

## 팩트

- 추가 학습에는 YT-Temporal-1B의 가공하지 않은 영상 클립을 사용했다
- 2026-10-09 발표

## 왜 중요한가

이번 결과는 대규모 언어 모델이 캡션 없이도 가공하지 않은 영상에서 시각 능력을 익힐 수 있음을 보여준다. 멀티모달 AI 성능을 높이는 비용을 줄일 새로운 길이 열릴 수 있다.

## 출처 및 참고 자료

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

최종 업데이트: 2026-10-09
