Tencent разместила Youtu-Parsing-Omni на Hugging Face. Компактная модель с 5 млрд параметров принимает один входной файл — например, текстовую страницу, фотографию, график, аудиозапись или видео — и возвращает структурированный JSON с описанием макета, текста, таблиц, формул, временных меток и субтитров. Среди открытых моделей она набрала высший общий балл в тесте OmniDocBench, а в OmniParsingBench заняла второе место, уступив только Gemini-3-Pro. Для удобного развертывания доступны плагин для vLLM и примеры запуска инференса.
Почему это важно
Разработчики смогут добавлять в приложения анализ разных типов данных без отдельных моделей для OCR, аудио и видео.