Oossa

Tencent pubblica Youtu-Parsing-Omni, modello multimodale da 5B

Disponibile su Hugging Face, il nuovo modello legge documenti, immagini, grafici, audio e video e restituisce un’unica struttura JSON.

BreveDi Pubblicato da Oossa: 1 min di lettura

Tencent ha caricato Youtu-Parsing-Omni su Hugging Face. È un modello compatto da 5 miliardi di parametri, capace di elaborare un singolo input — come una pagina di testo, una fotografia, un grafico, una clip audio o un video — e restituire una struttura JSON che descrive impaginazione, testo, tabelle, formule, timestamp e didascalie. Tra i modelli open ha ottenuto il punteggio complessivo più alto nel benchmark OmniDocBench e si è classificato secondo, dietro solo a Gemini-3-Pro, su OmniParsingBench. Per semplificarne la distribuzione sono inclusi un plugin per vLLM ed esempi di inferenza.

Perché conta

Gli sviluppatori possono integrare nelle app la comprensione di documenti di più tipi senza dover ricorrere a modelli distinti per OCR, audio o video.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.