# Entrenar Qwen3 con videos web mejora sus resultados visuales

> Los investigadores descubrieron que exponer a un modelo de lenguaje de 1.7 B de parámetros a clips de video sin procesar mejora sus resultados en tareas de imagen y video sin perjudicar su capacidad lingüística.

Oossa · 2026-10-09 · https://oossa.com/es/mid-training-qwen3-on-raw-web-video-boosts-vision-benchmarks

Jaedong Hwang y sus colegas continuaron el entrenamiento del modelo Qwen3‑1.7B con clips sin subtítulos del conjunto de videos YT‑Temporal‑1B. Tras aplicarle el mismo ajuste de instrucciones que al modelo de referencia, la versión entrenada con videos obtuvo un promedio 2.9 puntos más alto en cuatro pruebas de video y 5.1 puntos más alto en diez pruebas de imagen. El rendimiento en tareas de texto se mantuvo prácticamente igual: un promedio de 48.9, frente a 48.0 del modelo de referencia.

## Los hechos

- El entrenamiento adicional utilizó clips sin procesar de YT‑Temporal‑1B
- Publicado el 2026‑10‑09

## Por qué importa

El resultado demuestra que los grandes modelos de lenguaje pueden aprender habilidades visuales a partir de videos sin procesar y sin subtítulos, lo que abre una vía más económica para mejorar la IA multimodal.

## Fuentes y referencias

1. [Mid-Training Language Models on Raw Video](https://arxiv.org/abs/2610.11019) – arXiv cs.CV, 2026-10-09

Última actualización: 2026-10-09
