Tencent ha caricato Youtu-Parsing-Omni su Hugging Face. È un modello compatto da 5 miliardi di parametri, capace di elaborare un singolo input — come una pagina di testo, una fotografia, un grafico, una clip audio o un video — e restituire una struttura JSON che descrive impaginazione, testo, tabelle, formule, timestamp e didascalie. Tra i modelli open ha ottenuto il punteggio complessivo più alto nel benchmark OmniDocBench e si è classificato secondo, dietro solo a Gemini-3-Pro, su OmniParsingBench. Per semplificarne la distribuzione sono inclusi un plugin per vLLM ed esempi di inferenza.
Perché conta
Gli sviluppatori possono integrare nelle app la comprensione di documenti di più tipi senza dover ricorrere a modelli distinti per OCR, audio o video.