# Дообучение Qwen3 на веб-видео улучшило результаты в задачах на зрение

> Исследователи выяснили, что необработанные видеоролики повышают результаты языковой модели с 1.7 B параметрами в задачах с изображениями и видео, не ухудшая её навыки работы с текстом.

Oossa · 2026-10-09 · https://oossa.com/ru/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Джэдон Хван и его коллеги провели дополнительное обучение модели Qwen3‑1.7B на роликах без описаний из набора видео YT‑Temporal‑1B. После такой же настройки по инструкциям, что и у базовой модели, версия с дополнительным обучением на видео показала в среднем на 2.9 балла больше в четырёх тестах для видео и на 5.1 балла больше в десяти тестах для изображений. Результаты в текстовых задачах практически не изменились: средний балл составил 48.9 против 48.0 у базовой модели.

## Факты

- Для дополнительного обучения использовались необработанные ролики из YT‑Temporal‑1B
- Опубликовано 2026‑10‑09

## Почему это важно

Результат показывает, что большие языковые модели могут учиться визуальным навыкам на необработанных видео без описаний. Это открывает более доступный путь к созданию мультимодального ИИ с более высокими возможностями.

## Источники и ссылки

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Обновлено: 2026-10-09
