رفعت Tencent نموذج Youtu-Parsing-Omni إلى Hugging Face. وهو نموذج صغير يضم 5 مليارات مُعامل، ويمكنه استقبال مدخل واحد، مثل صفحة نصية أو صورة فوتوغرافية أو رسم بياني أو مقطع صوتي أو فيديو، ثم إرجاع بنية JSON منظّمة تصف التخطيط والنص والجداول والمعادلات والطوابع الزمنية والتعليقات التوضيحية. حقق النموذج أعلى نتيجة إجمالية بين النماذج مفتوحة المصدر في معيار OmniDocBench، وجاء في المرتبة الثانية بعد Gemini‑3‑Pro وحده في OmniParsingBench. ويتضمن إصدار النموذج إضافة لـvLLM وأمثلة للاستدلال لتسهيل تشغيله.
لماذا يهم
يمكن للمطورين إضافة إمكانات فهم المستندات متعددة الأنواع إلى التطبيقات من دون الحاجة إلى نماذج منفصلة للتعرّف الضوئي على الحروف والصوت والفيديو.