Oossa

Tencent lance Youtu-Parsing-Omni, un modèle multimodal de 5 milliards de paramètres

Disponible sur Hugging Face, ce nouveau modèle lit des documents, des images, des graphiques, de l’audio et des vidéos, puis produit une structure JSON unique.

BrèvePar Publié par Oossa: 1 min de lecture

Tencent a mis Youtu-Parsing-Omni en ligne sur Hugging Face. Ce modèle compact de 5 milliards de paramètres peut recevoir une seule entrée — une page de texte, une photo, un graphique, un extrait audio ou une vidéo, par exemple — et renvoyer une structure JSON décrivant la mise en page, le texte, les tableaux, les formules, les horodatages et les légendes. Parmi les modèles ouverts, il a obtenu le meilleur score global au benchmark OmniDocBench et s’est classé deuxième, derrière Gemini‑3‑Pro, à OmniParsingBench. Un plug-in vLLM et des exemples d’inférence sont également fournis pour faciliter son déploiement.

Pourquoi c'est important

Les développeurs peuvent intégrer la compréhension de plusieurs types de documents à leurs applications sans avoir à utiliser des modèles distincts pour l’OCR, l’audio et la vidéo.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.