# Tencent lança o modelo multimodal Youtu-Parsing-Omni, com 5B de parâmetros

> Disponível no Hugging Face, o modelo lê documentos, imagens, gráficos, áudio e vídeo e gera uma única estrutura JSON.

Oossa · 2026-10-09 · https://oossa.com/pt/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

A Tencent publicou o Youtu-Parsing-Omni no Hugging Face. O modelo compacto, com 5 bilhões de parâmetros, recebe uma única entrada — como uma página de texto, uma fotografia, um gráfico, um clipe de áudio ou um vídeo — e devolve uma estrutura JSON organizada que descreve o layout, o texto, as tabelas, as fórmulas, as marcas de tempo e as legendas. O modelo obteve a maior pontuação geral entre os modelos abertos no benchmark OmniDocBench e ficou em segundo lugar, atrás apenas do Gemini‑3‑Pro, no OmniParsingBench. O pacote inclui um plugin para vLLM e exemplos de inferência para facilitar a implantação.

## Os fatos

- 5B de parâmetros
- Lançado no Hugging Face em outubro de 2026

## Por que importa

Desenvolvedores podem adicionar a compreensão de documentos de vários tipos a aplicativos sem precisar de modelos separados para OCR, áudio ou vídeo.

## Fontes e referências

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Última atualização: 2026-10-09
