Jaedong Hwang과 동료 연구진은 캡션이 없는 YT-Temporal-1B 동영상 세트의 클립으로 Qwen3-1.7B 모델을 추가 학습했다. 기준 모델과 동일한 지시 튜닝을 거친 뒤 평가한 결과, 영상 추가 학습 모델은 4개 영상 벤치마크에서 평균 2.9점, 10개 이미지 벤치마크에서 평균 5.1점 더 높은 점수를 기록했다. 텍스트 성능은 사실상 변하지 않아 평균 점수는 48.9점으로, 기준 모델의 48.0점과 비슷했다.
왜 중요한가
이번 결과는 대규모 언어 모델이 캡션 없이도 가공하지 않은 영상에서 시각 능력을 익힐 수 있음을 보여준다. 멀티모달 AI 성능을 높이는 비용을 줄일 새로운 길이 열릴 수 있다.