Oossa

Tencent выпустила мультимодальную модель Youtu-Parsing-Omni на 5 млрд параметров

Модель на Hugging Face анализирует документы, изображения, графики, аудио и видео и возвращает данные в формате JSON.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Tencent разместила Youtu-Parsing-Omni на Hugging Face. Компактная модель с 5 млрд параметров принимает один входной файл — например, текстовую страницу, фотографию, график, аудиозапись или видео — и возвращает структурированный JSON с описанием макета, текста, таблиц, формул, временных меток и субтитров. Среди открытых моделей она набрала высший общий балл в тесте OmniDocBench, а в OmniParsingBench заняла второе место, уступив только Gemini-3-Pro. Для удобного развертывания доступны плагин для vLLM и примеры запуска инференса.

Почему это важно

Разработчики смогут добавлять в приложения анализ разных типов данных без отдельных моделей для OCR, аудио и видео.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.