Jaedong Hwang 及其同事使用 YT-Temporal-1B 视频数据集中的无字幕片段,对 Qwen3-1.7B 模型进行了中期训练。随后,该模型接受了与基线模型相同的指令微调。在四项视频基准测试中,经过视频中期训练的模型平均得分高出 2.9 分;在十项图像基准测试中,平均得分高出 5.1 分。文本表现基本不变,平均得分为 48.9,而基线模型为 48.0。
为什么重要
这一结果表明,大型语言模型无需字幕也能从原始视频中学会视觉技能,为提升多模态 AI 提供了一条成本更低的途径。
研究人员发现,让一个拥有 1.7B 参数的语言模型学习原始视频片段,可以提高其图像和视频任务得分,同时不影响文本能力。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
Jaedong Hwang 及其同事使用 YT-Temporal-1B 视频数据集中的无字幕片段,对 Qwen3-1.7B 模型进行了中期训练。随后,该模型接受了与基线模型相同的指令微调。在四项视频基准测试中,经过视频中期训练的模型平均得分高出 2.9 分;在十项图像基准测试中,平均得分高出 5.1 分。文本表现基本不变,平均得分为 48.9,而基线模型为 48.0。
这一结果表明,大型语言模型无需字幕也能从原始视频中学会视觉技能,为提升多模态 AI 提供了一条成本更低的途径。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。