Oossa

Дообучение Qwen3 на веб-видео улучшило результаты в задачах на зрение

Исследователи выяснили, что необработанные видеоролики повышают результаты языковой модели с 1.7 B параметрами в задачах с изображениями и видео, не ухудшая её навыки работы с текстом.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Джэдон Хван и его коллеги провели дополнительное обучение модели Qwen3‑1.7B на роликах без описаний из набора видео YT‑Temporal‑1B. После такой же настройки по инструкциям, что и у базовой модели, версия с дополнительным обучением на видео показала в среднем на 2.9 балла больше в четырёх тестах для видео и на 5.1 балла больше в десяти тестах для изображений. Результаты в текстовых задачах практически не изменились: средний балл составил 48.9 против 48.0 у базовой модели.

Почему это важно

Результат показывает, что большие языковые модели могут учиться визуальным навыкам на необработанных видео без описаний. Это открывает более доступный путь к созданию мультимодального ИИ с более высокими возможностями.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.