# Tencent lanza Youtu-Parsing-Omni, un modelo multimodal de 5B

> El nuevo modelo de Hugging Face puede leer documentos, imágenes, gráficos, audio y video, y devolverlo todo en una única estructura JSON.

Oossa · 2026-10-09 · https://oossa.com/es/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent ha subido Youtu-Parsing-Omni a Hugging Face. Es un modelo compacto de 5.000 millones de parámetros que puede recibir una sola entrada —como una página de texto, una fotografía, un gráfico, un clip de audio o un video— y devolver una estructura JSON con información sobre la disposición, el texto, las tablas, las fórmulas, las marcas de tiempo y los pies de foto. El modelo obtuvo la puntuación general más alta entre los modelos abiertos en la prueba OmniDocBench y quedó en segundo lugar, solo por detrás de Gemini‑3‑Pro, en OmniParsingBench. También incluye un complemento para vLLM y ejemplos de inferencia para facilitar su implementación.

## Los hechos

- 5.000 millones de parámetros
- Publicado en Hugging Face en octubre de 2026

## Por qué importa

Los desarrolladores pueden incorporar a sus aplicaciones la comprensión de documentos de distintos tipos sin necesitar modelos independientes de OCR, audio o video.

## Fuentes y referencias

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Última actualización: 2026-10-09
