Oossa

用原始网络视频进行中期训练,提升 Qwen3 视觉基准成绩

研究人员发现,让一个拥有 1.7B 参数的语言模型学习原始视频片段,可以提高其图像和视频任务得分,同时不影响文本能力。

简讯作者: Oossa 发布日期: 1 分钟阅读

Jaedong Hwang 及其同事使用 YT-Temporal-1B 视频数据集中的无字幕片段,对 Qwen3-1.7B 模型进行了中期训练。随后,该模型接受了与基线模型相同的指令微调。在四项视频基准测试中,经过视频中期训练的模型平均得分高出 2.9 分;在十项图像基准测试中,平均得分高出 5.1 分。文本表现基本不变,平均得分为 48.9,而基线模型为 48.0。

为什么重要

这一结果表明,大型语言模型无需字幕也能从原始视频中学会视觉技能,为提升多模态 AI 提供了一条成本更低的途径。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。