Джэдон Хван и его коллеги провели дополнительное обучение модели Qwen3‑1.7B на роликах без описаний из набора видео YT‑Temporal‑1B. После такой же настройки по инструкциям, что и у базовой модели, версия с дополнительным обучением на видео показала в среднем на 2.9 балла больше в четырёх тестах для видео и на 5.1 балла больше в десяти тестах для изображений. Результаты в текстовых задачах практически не изменились: средний балл составил 48.9 против 48.0 у базовой модели.
Почему это важно
Результат показывает, что большие языковые модели могут учиться визуальным навыкам на необработанных видео без описаний. Это открывает более доступный путь к созданию мультимодального ИИ с более высокими возможностями.