Tencent ha subido Youtu-Parsing-Omni a Hugging Face. Es un modelo compacto de 5.000 millones de parámetros que puede recibir una sola entrada —como una página de texto, una fotografía, un gráfico, un clip de audio o un video— y devolver una estructura JSON con información sobre la disposición, el texto, las tablas, las fórmulas, las marcas de tiempo y los pies de foto. El modelo obtuvo la puntuación general más alta entre los modelos abiertos en la prueba OmniDocBench y quedó en segundo lugar, solo por detrás de Gemini‑3‑Pro, en OmniParsingBench. También incluye un complemento para vLLM y ejemplos de inferencia para facilitar su implementación.
Por qué importa
Los desarrolladores pueden incorporar a sus aplicaciones la comprensión de documentos de distintos tipos sin necesitar modelos independientes de OCR, audio o video.