Tencent ने Youtu-Parsing-Omni को Hugging Face पर अपलोड किया है। यह 5 बिलियन पैरामीटर वाला कॉम्पैक्ट मॉडल है, जो एक ही इनपुट—जैसे टेक्स्ट का पन्ना, तस्वीर, चार्ट, ऑडियो क्लिप या वीडियो—लेकर लेआउट, टेक्स्ट, टेबल, फ़ॉर्मूले, टाइमस्टैम्प और कैप्शन का ब्यौरा देने वाला संरचित JSON आउटपुट देता है। खुले मॉडलों में इसने OmniDocBench बेंचमार्क पर सबसे अधिक Overall स्कोर हासिल किया और OmniParsingBench पर Gemini‑3‑Pro के बाद दूसरे स्थान पर रहा। इसे आसानी से सर्व करने के लिए vLLM प्लगइन और इन्फ़रेंस के उदाहरण भी शामिल हैं।
यह क्यों मायने रखता है
डेवलपर अलग-अलग OCR, ऑडियो या वीडियो मॉडल की ज़रूरत के बिना ऐप्स में कई तरह के दस्तावेज़ समझने की क्षमता जोड़ सकते हैं।