# Tencent pubblica Youtu-Parsing-Omni, modello multimodale da 5B

> Disponibile su Hugging Face, il nuovo modello legge documenti, immagini, grafici, audio e video e restituisce un’unica struttura JSON.

Oossa · 2026-10-09 · https://oossa.com/it/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent ha caricato Youtu-Parsing-Omni su Hugging Face. È un modello compatto da 5 miliardi di parametri, capace di elaborare un singolo input — come una pagina di testo, una fotografia, un grafico, una clip audio o un video — e restituire una struttura JSON che descrive impaginazione, testo, tabelle, formule, timestamp e didascalie. Tra i modelli open ha ottenuto il punteggio complessivo più alto nel benchmark OmniDocBench e si è classificato secondo, dietro solo a Gemini-3-Pro, su OmniParsingBench. Per semplificarne la distribuzione sono inclusi un plugin per vLLM ed esempi di inferenza.

## I fatti

- 5B di parametri
- Pubblicato su Hugging Face nell’ottobre 2026

## Perché conta

Gli sviluppatori possono integrare nelle app la comprensione di documenti di più tipi senza dover ricorrere a modelli distinti per OCR, audio o video.

## Fonti e riferimenti

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Ultimo aggiornamento: 2026-10-09
