Oossa

Tencent lanza Youtu-Parsing-Omni, un modelo multimodal de 5B

El nuevo modelo de Hugging Face puede leer documentos, imágenes, gráficos, audio y video, y devolverlo todo en una única estructura JSON.

BrevePor Publicado por Oossa: 1 min de lectura

Tencent ha subido Youtu-Parsing-Omni a Hugging Face. Es un modelo compacto de 5.000 millones de parámetros que puede recibir una sola entrada —como una página de texto, una fotografía, un gráfico, un clip de audio o un video— y devolver una estructura JSON con información sobre la disposición, el texto, las tablas, las fórmulas, las marcas de tiempo y los pies de foto. El modelo obtuvo la puntuación general más alta entre los modelos abiertos en la prueba OmniDocBench y quedó en segundo lugar, solo por detrás de Gemini‑3‑Pro, en OmniParsingBench. También incluye un complemento para vLLM y ejemplos de inferencia para facilitar su implementación.

Por qué importa

Los desarrolladores pueden incorporar a sus aplicaciones la comprensión de documentos de distintos tipos sin necesitar modelos independientes de OCR, audio o video.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.