# Tencent تطلق نموذج Youtu-Parsing-Omni متعدد الوسائط بـ5 مليارات مُعامل

> يستطيع النموذج الجديد على Hugging Face قراءة المستندات والصور والرسوم البيانية والصوت والفيديو، وإخراجها في بنية JSON موحّدة.

Oossa · 2026-10-09 · https://oossa.com/ar/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

رفعت Tencent نموذج Youtu-Parsing-Omni إلى Hugging Face. وهو نموذج صغير يضم 5 مليارات مُعامل، ويمكنه استقبال مدخل واحد، مثل صفحة نصية أو صورة فوتوغرافية أو رسم بياني أو مقطع صوتي أو فيديو، ثم إرجاع بنية JSON منظّمة تصف التخطيط والنص والجداول والمعادلات والطوابع الزمنية والتعليقات التوضيحية. حقق النموذج أعلى نتيجة إجمالية بين النماذج مفتوحة المصدر في معيار OmniDocBench، وجاء في المرتبة الثانية بعد Gemini‑3‑Pro وحده في OmniParsingBench. ويتضمن إصدار النموذج إضافة لـvLLM وأمثلة للاستدلال لتسهيل تشغيله.

## الحقائق

- 5 مليارات مُعامل
- أُطلق على Hugging Face في أكتوبر 2026

## لماذا يهم

يمكن للمطورين إضافة إمكانات فهم المستندات متعددة الأنواع إلى التطبيقات من دون الحاجة إلى نماذج منفصلة للتعرّف الضوئي على الحروف والصوت والفيديو.

## المصادر والمراجع

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

آخر تحديث: 2026-10-09
