Oossa

生動画でQwen3を追加学習、画像・動画ベンチマークで向上

研究チームは、17億パラメーターの言語モデルに生の動画クリップを学習させ、テキスト能力を損なわずに画像・動画タスクのスコアを伸ばせることを示した。

短信著者: Oossa公開日: 1 分で読める

Jaedong Hwang氏らは、キャプションのない動画データセット「YT-Temporal-1B」のクリップを使い、Qwen3-1.7Bモデルを追加学習させた。ベースラインモデルと同じ指示チューニングを行った後、動画で追加学習したモデルは、4つの動画ベンチマークの平均で2.9ポイント、10の画像ベンチマークで5.1ポイント高いスコアを記録した。テキスト性能はほぼ変わらず、平均スコアはベースラインの48.0に対して48.9だった。

なぜ重要か

大規模言語モデルはキャプションのない生動画から視覚能力を学べることが示された。マルチモーダルAIの性能を、より低コストで高める道が開ける。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。