Oossa

腾讯发布 Youtu-Parsing-Omni:50亿参数全模态解析模型

这款新模型已上线 Hugging Face,可读取文档、图片、图表、音频和视频,并输出统一的 JSON 结构。

简讯作者: Oossa 发布日期: 1 分钟阅读

腾讯已将 Youtu-Parsing-Omni 上传至 Hugging Face。这是一款规模精简、拥有50亿参数的模型,可接收单一输入,例如文本页面、照片、图表、音频片段或视频,并返回结构化 JSON,描述版面、文本、表格、公式、时间戳和字幕。在开放模型中,该模型在 OmniDocBench 基准测试中取得最高 Overall 分数;在 OmniParsingBench 上则仅次于 Gemini‑3‑Pro,排名第二。模型还附带 vLLM 插件和推理示例,方便部署。

为什么重要

开发者无需分别使用 OCR、音频或视频模型,就能在应用中加入对多种类型文档的理解能力。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。