Oossa

انتشار مدل چندوجهی Youtu-Parsing-Omni با 5B پارامتر

مدل تازه Tencent در Hugging Face می‌تواند اسناد، تصاویر، نمودارها، صدا و ویدئو را بخواند و همه را در قالب یک ساختار JSON ارائه کند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

Tencent مدل Youtu-Parsing-Omni را در Hugging Face منتشر کرده است. این مدل جمع‌وجور با 5 billion پارامتر می‌تواند یک ورودی واحد—مانند صفحه‌ای از متن، عکس، نمودار، فایل صوتی یا ویدئو—دریافت کند و ساختاری JSON ارائه دهد که چیدمان، متن، جدول‌ها، فرمول‌ها، مُهرهای زمانی و زیرنویس‌ها را توصیف می‌کند. این مدل در میان مدل‌های متن‌باز، بالاترین امتیاز Overall را در بنچمارک OmniDocBench کسب کرد و در OmniParsingBench، پس از Gemini‑3‑Pro در جایگاه دوم قرار گرفت. برای راه‌اندازی آسان، افزونه vLLM و نمونه‌هایی برای استنتاج هم ارائه شده‌اند.

چرا مهم است

توسعه‌دهندگان می‌توانند بدون نیاز به مدل‌های جداگانه OCR، صوت یا ویدئو، قابلیت درک انواع مختلف اسناد را به اپلیکیشن‌ها اضافه کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.