Tencent مدل Youtu-Parsing-Omni را در Hugging Face منتشر کرده است. این مدل جمعوجور با 5 billion پارامتر میتواند یک ورودی واحد—مانند صفحهای از متن، عکس، نمودار، فایل صوتی یا ویدئو—دریافت کند و ساختاری JSON ارائه دهد که چیدمان، متن، جدولها، فرمولها، مُهرهای زمانی و زیرنویسها را توصیف میکند. این مدل در میان مدلهای متنباز، بالاترین امتیاز Overall را در بنچمارک OmniDocBench کسب کرد و در OmniParsingBench، پس از Gemini‑3‑Pro در جایگاه دوم قرار گرفت. برای راهاندازی آسان، افزونه vLLM و نمونههایی برای استنتاج هم ارائه شدهاند.
چرا مهم است
توسعهدهندگان میتوانند بدون نیاز به مدلهای جداگانه OCR، صوت یا ویدئو، قابلیت درک انواع مختلف اسناد را به اپلیکیشنها اضافه کنند.