# Tencent、5Bのマルチモーダル解析モデル「Youtu-Parsing-Omni」を公開

> Hugging Faceで公開された新モデルは、文書や画像、グラフ、音声、動画を読み取り、単一のJSON構造で出力する。

Oossa · 2026-10-09 · https://oossa.com/ja/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencentは「Youtu-Parsing-Omni」をHugging Faceにアップロードした。50億パラメーターの小型モデルで、テキストのページ、写真、グラフ、音声クリップ、動画などを入力すると、レイアウト、テキスト、表、数式、タイムスタンプ、キャプションを記述した構造化JSONを返す。オープンモデルの中ではベンチマーク「OmniDocBench」のOverallスコアで最高を記録し、「OmniParsingBench」ではGemini-3-Proに次ぐ2位となった。手軽にサービングできるよう、vLLMプラグインと推論のサンプルも付属する。

## 事実

- パラメーター数は5B
- 2026年10月にHugging Faceで公開

## なぜ重要か

開発者は、OCRや音声、動画のモデルを別々に用意しなくても、複数形式の文書理解機能をアプリに追加できる。

## 出典と参考資料

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

最終更新: 2026-10-09
