# 生動画でQwen3を追加学習、画像・動画ベンチマークで向上

> 研究チームは、17億パラメーターの言語モデルに生の動画クリップを学習させ、テキスト能力を損なわずに画像・動画タスクのスコアを伸ばせることを示した。

Oossa · 2026-10-09 · https://oossa.com/ja/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang氏らは、キャプションのない動画データセット「YT-Temporal-1B」のクリップを使い、Qwen3-1.7Bモデルを追加学習させた。ベースラインモデルと同じ指示チューニングを行った後、動画で追加学習したモデルは、4つの動画ベンチマークの平均で2.9ポイント、10の画像ベンチマークで5.1ポイント高いスコアを記録した。テキスト性能はほぼ変わらず、平均スコアはベースラインの48.0に対して48.9だった。

## 事実

- 追加学習にはYT-Temporal-1Bの生動画クリップを使用
- 公開日：2026-10-09

## なぜ重要か

大規模言語モデルはキャプションのない生動画から視覚能力を学べることが示された。マルチモーダルAIの性能を、より低コストで高める道が開ける。

## 出典と参考資料

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

最終更新: 2026-10-09
