Oossa

Tencent lança o modelo multimodal Youtu-Parsing-Omni, com 5B de parâmetros

Disponível no Hugging Face, o modelo lê documentos, imagens, gráficos, áudio e vídeo e gera uma única estrutura JSON.

NotaPor Publicado pelo Oossa: 1 min de leitura

A Tencent publicou o Youtu-Parsing-Omni no Hugging Face. O modelo compacto, com 5 bilhões de parâmetros, recebe uma única entrada — como uma página de texto, uma fotografia, um gráfico, um clipe de áudio ou um vídeo — e devolve uma estrutura JSON organizada que descreve o layout, o texto, as tabelas, as fórmulas, as marcas de tempo e as legendas. O modelo obteve a maior pontuação geral entre os modelos abertos no benchmark OmniDocBench e ficou em segundo lugar, atrás apenas do Gemini‑3‑Pro, no OmniParsingBench. O pacote inclui um plugin para vLLM e exemplos de inferência para facilitar a implantação.

Por que importa

Desenvolvedores podem adicionar a compreensão de documentos de vários tipos a aplicativos sem precisar de modelos separados para OCR, áudio ou vídeo.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.