Tencent har laddat upp Youtu-Parsing-Omni till Hugging Face. Det är en kompakt modell med 5 miljarder parametrar som kan ta emot en enda indata – till exempel en textsida, ett fotografi, ett diagram, ett ljudklipp eller en video – och returnera ett strukturerat JSON-objekt med uppgifter om layout, text, tabeller, formler, tidsstämplar och bildtexter. Modellen fick högst totalpoäng bland öppna modeller i benchmarktestet OmniDocBench och kom på andra plats efter Gemini‑3‑Pro i OmniParsingBench. En vLLM-plugin och exempel på inferens ingår för enkel driftsättning.
Varför det spelar roll
Utvecklare kan lägga till stöd för dokument med flera medietyper i appar utan att behöva separata modeller för OCR, ljud och video.