Tencent heeft Youtu-Parsing-Omni op Hugging Face gezet. Het compacte model met 5 miljard parameters kan één invoer verwerken — bijvoorbeeld een pagina met tekst, een foto, een grafiek, een audiofragment of een video — en daar een gestructureerde JSON-container van maken met informatie over de indeling, tekst, tabellen, formules, tijdstempels en bijschriften. Van de open modellen behaalde het de hoogste totaalscore op de benchmark OmniDocBench. Op OmniParsingBench eindigde het op de tweede plaats, achter alleen Gemini‑3‑Pro. Voor eenvoudig gebruik zijn ook een vLLM-plug-in en voorbeelden voor inferentie inbegrepen.
Waarom het ertoe doet
Ontwikkelaars kunnen apps documentbegrip voor verschillende soorten media geven zonder aparte modellen voor OCR, audio of video nodig te hebben.