腾讯已将 Youtu-Parsing-Omni 上传至 Hugging Face。这是一款规模精简、拥有50亿参数的模型,可接收单一输入,例如文本页面、照片、图表、音频片段或视频,并返回结构化 JSON,描述版面、文本、表格、公式、时间戳和字幕。在开放模型中,该模型在 OmniDocBench 基准测试中取得最高 Overall 分数;在 OmniParsingBench 上则仅次于 Gemini‑3‑Pro,排名第二。模型还附带 vLLM 插件和推理示例,方便部署。
为什么重要
开发者无需分别使用 OCR、音频或视频模型,就能在应用中加入对多种类型文档的理解能力。