# 腾讯发布 Youtu-Parsing-Omni：50亿参数全模态解析模型

> 这款新模型已上线 Hugging Face，可读取文档、图片、图表、音频和视频，并输出统一的 JSON 结构。

Oossa · 2026-10-09 · https://oossa.com/zh/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

腾讯已将 Youtu-Parsing-Omni 上传至 Hugging Face。这是一款规模精简、拥有50亿参数的模型，可接收单一输入，例如文本页面、照片、图表、音频片段或视频，并返回结构化 JSON，描述版面、文本、表格、公式、时间戳和字幕。在开放模型中，该模型在 OmniDocBench 基准测试中取得最高 Overall 分数；在 OmniParsingBench 上则仅次于 Gemini‑3‑Pro，排名第二。模型还附带 vLLM 插件和推理示例，方便部署。

## 事实

- 50亿参数
- 于2026年10月在 Hugging Face 发布

## 为什么重要

开发者无需分别使用 OCR、音频或视频模型，就能在应用中加入对多种类型文档的理解能力。

## 来源与参考

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

最后更新: 2026-10-09
