# Tencent lance Youtu-Parsing-Omni, un modèle multimodal de 5 milliards de paramètres

> Disponible sur Hugging Face, ce nouveau modèle lit des documents, des images, des graphiques, de l’audio et des vidéos, puis produit une structure JSON unique.

Oossa · 2026-10-09 · https://oossa.com/fr/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent a mis Youtu-Parsing-Omni en ligne sur Hugging Face. Ce modèle compact de 5 milliards de paramètres peut recevoir une seule entrée — une page de texte, une photo, un graphique, un extrait audio ou une vidéo, par exemple — et renvoyer une structure JSON décrivant la mise en page, le texte, les tableaux, les formules, les horodatages et les légendes. Parmi les modèles ouverts, il a obtenu le meilleur score global au benchmark OmniDocBench et s’est classé deuxième, derrière Gemini‑3‑Pro, à OmniParsingBench. Un plug-in vLLM et des exemples d’inférence sont également fournis pour faciliter son déploiement.

## Les faits

- 5 milliards de paramètres
- Publié sur Hugging Face en octobre 2026

## Pourquoi c'est important

Les développeurs peuvent intégrer la compréhension de plusieurs types de documents à leurs applications sans avoir à utiliser des modèles distincts pour l’OCR, l’audio et la vidéo.

## Sources et références

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Dernière mise à jour: 2026-10-09
