Oossa

웹 영상으로 추가 학습한 Qwen3, 비전 벤치마크 성적 향상

연구진은 17억 개 파라미터를 가진 언어 모델에 가공하지 않은 영상 클립을 학습시켜, 텍스트 능력은 유지하면서 이미지·영상 과제 점수를 높였다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Jaedong Hwang과 동료 연구진은 캡션이 없는 YT-Temporal-1B 동영상 세트의 클립으로 Qwen3-1.7B 모델을 추가 학습했다. 기준 모델과 동일한 지시 튜닝을 거친 뒤 평가한 결과, 영상 추가 학습 모델은 4개 영상 벤치마크에서 평균 2.9점, 10개 이미지 벤치마크에서 평균 5.1점 더 높은 점수를 기록했다. 텍스트 성능은 사실상 변하지 않아 평균 점수는 48.9점으로, 기준 모델의 48.0점과 비슷했다.

왜 중요한가

이번 결과는 대규모 언어 모델이 캡션 없이도 가공하지 않은 영상에서 시각 능력을 익힐 수 있음을 보여준다. 멀티모달 AI 성능을 높이는 비용을 줄일 새로운 길이 열릴 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.