A Tencent publicou o Youtu-Parsing-Omni no Hugging Face. O modelo compacto, com 5 bilhões de parâmetros, recebe uma única entrada — como uma página de texto, uma fotografia, um gráfico, um clipe de áudio ou um vídeo — e devolve uma estrutura JSON organizada que descreve o layout, o texto, as tabelas, as fórmulas, as marcas de tempo e as legendas. O modelo obteve a maior pontuação geral entre os modelos abertos no benchmark OmniDocBench e ficou em segundo lugar, atrás apenas do Gemini‑3‑Pro, no OmniParsingBench. O pacote inclui um plugin para vLLM e exemplos de inferência para facilitar a implantação.
Por que importa
Desenvolvedores podem adicionar a compreensão de documentos de vários tipos a aplicativos sem precisar de modelos separados para OCR, áudio ou vídeo.