# Tencent выпустила мультимодальную модель Youtu-Parsing-Omni на 5 млрд параметров

> Модель на Hugging Face анализирует документы, изображения, графики, аудио и видео и возвращает данные в формате JSON.

Oossa · 2026-10-09 · https://oossa.com/ru/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent разместила Youtu-Parsing-Omni на Hugging Face. Компактная модель с 5 млрд параметров принимает один входной файл — например, текстовую страницу, фотографию, график, аудиозапись или видео — и возвращает структурированный JSON с описанием макета, текста, таблиц, формул, временных меток и субтитров. Среди открытых моделей она набрала высший общий балл в тесте OmniDocBench, а в OmniParsingBench заняла второе место, уступив только Gemini-3-Pro. Для удобного развертывания доступны плагин для vLLM и примеры запуска инференса.

## Факты

- 5 млрд параметров
- Выпущена на Hugging Face в октябре 2026 года

## Почему это важно

Разработчики смогут добавлять в приложения анализ разных типов данных без отдельных моделей для OCR, аудио и видео.

## Источники и ссылки

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Обновлено: 2026-10-09
