Tencent a mis Youtu-Parsing-Omni en ligne sur Hugging Face. Ce modèle compact de 5 milliards de paramètres peut recevoir une seule entrée — une page de texte, une photo, un graphique, un extrait audio ou une vidéo, par exemple — et renvoyer une structure JSON décrivant la mise en page, le texte, les tableaux, les formules, les horodatages et les légendes. Parmi les modèles ouverts, il a obtenu le meilleur score global au benchmark OmniDocBench et s’est classé deuxième, derrière Gemini‑3‑Pro, à OmniParsingBench. Un plug-in vLLM et des exemples d’inférence sont également fournis pour faciliter son déploiement.
Pourquoi c'est important
Les développeurs peuvent intégrer la compréhension de plusieurs types de documents à leurs applications sans avoir à utiliser des modèles distincts pour l’OCR, l’audio et la vidéo.