Oossa

Entrenar Qwen3 con videos web mejora sus resultados visuales

Los investigadores descubrieron que exponer a un modelo de lenguaje de 1.7 B de parámetros a clips de video sin procesar mejora sus resultados en tareas de imagen y video sin perjudicar su capacidad lingüística.

BrevePor Publicado por Oossa: 1 min de lectura

Jaedong Hwang y sus colegas continuaron el entrenamiento del modelo Qwen3‑1.7B con clips sin subtítulos del conjunto de videos YT‑Temporal‑1B. Tras aplicarle el mismo ajuste de instrucciones que al modelo de referencia, la versión entrenada con videos obtuvo un promedio 2.9 puntos más alto en cuatro pruebas de video y 5.1 puntos más alto en diez pruebas de imagen. El rendimiento en tareas de texto se mantuvo prácticamente igual: un promedio de 48.9, frente a 48.0 del modelo de referencia.

Por qué importa

El resultado demuestra que los grandes modelos de lenguaje pueden aprender habilidades visuales a partir de videos sin procesar y sin subtítulos, lo que abre una vía más económica para mejorar la IA multimodal.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.