Jaedong Hwang y sus colegas continuaron el entrenamiento del modelo Qwen3‑1.7B con clips sin subtítulos del conjunto de videos YT‑Temporal‑1B. Tras aplicarle el mismo ajuste de instrucciones que al modelo de referencia, la versión entrenada con videos obtuvo un promedio 2.9 puntos más alto en cuatro pruebas de video y 5.1 puntos más alto en diez pruebas de imagen. El rendimiento en tareas de texto se mantuvo prácticamente igual: un promedio de 48.9, frente a 48.0 del modelo de referencia.
Por qué importa
El resultado demuestra que los grandes modelos de lenguaje pueden aprender habilidades visuales a partir de videos sin procesar y sin subtítulos, lo que abre una vía más económica para mejorar la IA multimodal.