Oossa

Tencent brengt Youtu-Parsing-Omni uit, een multimodaal model met 5B parameters

Het nieuwe model op Hugging Face kan documenten, afbeeldingen, grafieken, audio en video verwerken en alles samenvoegen in één JSON-structuur.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Tencent heeft Youtu-Parsing-Omni op Hugging Face gezet. Het compacte model met 5 miljard parameters kan één invoer verwerken — bijvoorbeeld een pagina met tekst, een foto, een grafiek, een audiofragment of een video — en daar een gestructureerde JSON-container van maken met informatie over de indeling, tekst, tabellen, formules, tijdstempels en bijschriften. Van de open modellen behaalde het de hoogste totaalscore op de benchmark OmniDocBench. Op OmniParsingBench eindigde het op de tweede plaats, achter alleen Gemini‑3‑Pro. Voor eenvoudig gebruik zijn ook een vLLM-plug-in en voorbeelden voor inferentie inbegrepen.

Waarom het ertoe doet

Ontwikkelaars kunnen apps documentbegrip voor verschillende soorten media geven zonder aparte modellen voor OCR, audio of video nodig te hebben.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.