# 用原始网络视频进行中期训练，提升 Qwen3 视觉基准成绩

> 研究人员发现，让一个拥有 1.7B 参数的语言模型学习原始视频片段，可以提高其图像和视频任务得分，同时不影响文本能力。

Oossa · 2026-10-09 · https://oossa.com/zh/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang 及其同事使用 YT-Temporal-1B 视频数据集中的无字幕片段，对 Qwen3-1.7B 模型进行了中期训练。随后，该模型接受了与基线模型相同的指令微调。在四项视频基准测试中，经过视频中期训练的模型平均得分高出 2.9 分；在十项图像基准测试中，平均得分高出 5.1 分。文本表现基本不变，平均得分为 48.9，而基线模型为 48.0。

## 事实

- 中期训练使用了 YT-Temporal-1B 中的原始视频片段
- 发表于 2026-10-09

## 为什么重要

这一结果表明，大型语言模型无需字幕也能从原始视频中学会视觉技能，为提升多模态 AI 提供了一条成本更低的途径。

## 来源与参考

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

最后更新: 2026-10-09
