# انتشار مدل چندوجهی Youtu-Parsing-Omni با 5B پارامتر

> مدل تازه Tencent در Hugging Face می‌تواند اسناد، تصاویر، نمودارها، صدا و ویدئو را بخواند و همه را در قالب یک ساختار JSON ارائه کند.

Oossa · 2026-10-09 · https://oossa.com/fa/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent مدل Youtu-Parsing-Omni را در Hugging Face منتشر کرده است. این مدل جمع‌وجور با 5 billion پارامتر می‌تواند یک ورودی واحد—مانند صفحه‌ای از متن، عکس، نمودار، فایل صوتی یا ویدئو—دریافت کند و ساختاری JSON ارائه دهد که چیدمان، متن، جدول‌ها، فرمول‌ها، مُهرهای زمانی و زیرنویس‌ها را توصیف می‌کند. این مدل در میان مدل‌های متن‌باز، بالاترین امتیاز Overall را در بنچمارک OmniDocBench کسب کرد و در OmniParsingBench، پس از Gemini‑3‑Pro در جایگاه دوم قرار گرفت. برای راه‌اندازی آسان، افزونه vLLM و نمونه‌هایی برای استنتاج هم ارائه شده‌اند.

## حقایق

- 5 B پارامتر
- انتشار در Hugging Face در اکتبر 2026

## چرا مهم است

توسعه‌دهندگان می‌توانند بدون نیاز به مدل‌های جداگانه OCR، صوت یا ویدئو، قابلیت درک انواع مختلف اسناد را به اپلیکیشن‌ها اضافه کنند.

## منابع و ارجاع‌ها

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
