# Tencent brengt Youtu-Parsing-Omni uit, een multimodaal model met 5B parameters

> Het nieuwe model op Hugging Face kan documenten, afbeeldingen, grafieken, audio en video verwerken en alles samenvoegen in één JSON-structuur.

Oossa · 2026-10-09 · https://oossa.com/nl/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent heeft Youtu-Parsing-Omni op Hugging Face gezet. Het compacte model met 5 miljard parameters kan één invoer verwerken — bijvoorbeeld een pagina met tekst, een foto, een grafiek, een audiofragment of een video — en daar een gestructureerde JSON-container van maken met informatie over de indeling, tekst, tabellen, formules, tijdstempels en bijschriften. Van de open modellen behaalde het de hoogste totaalscore op de benchmark OmniDocBench. Op OmniParsingBench eindigde het op de tweede plaats, achter alleen Gemini‑3‑Pro. Voor eenvoudig gebruik zijn ook een vLLM-plug-in en voorbeelden voor inferentie inbegrepen.

## De feiten

- 5 miljard parameters
- Uitgebracht op Hugging Face in oktober 2026

## Waarom het ertoe doet

Ontwikkelaars kunnen apps documentbegrip voor verschillende soorten media geven zonder aparte modellen voor OCR, audio of video nodig te hebben.

## Bronnen en referenties

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Laatst bijgewerkt: 2026-10-09
