Oossa

Tencent släpper Youtu-Parsing-Omni, en multimodal modell med 5B parametrar

Den nya modellen på Hugging Face kan läsa dokument, bilder, diagram, ljud och video och sammanställa resultatet i en enda JSON-struktur.

NotisAv Publicerad av Oossa: 1 min läsning

Tencent har laddat upp Youtu-Parsing-Omni till Hugging Face. Det är en kompakt modell med 5 miljarder parametrar som kan ta emot en enda indata – till exempel en textsida, ett fotografi, ett diagram, ett ljudklipp eller en video – och returnera ett strukturerat JSON-objekt med uppgifter om layout, text, tabeller, formler, tidsstämplar och bildtexter. Modellen fick högst totalpoäng bland öppna modeller i benchmarktestet OmniDocBench och kom på andra plats efter Gemini‑3‑Pro i OmniParsingBench. En vLLM-plugin och exempel på inferens ingår för enkel driftsättning.

Varför det spelar roll

Utvecklare kan lägga till stöd för dokument med flera medietyper i appar utan att behöva separata modeller för OCR, ljud och video.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.