Tencentは「Youtu-Parsing-Omni」をHugging Faceにアップロードした。50億パラメーターの小型モデルで、テキストのページ、写真、グラフ、音声クリップ、動画などを入力すると、レイアウト、テキスト、表、数式、タイムスタンプ、キャプションを記述した構造化JSONを返す。オープンモデルの中ではベンチマーク「OmniDocBench」のOverallスコアで最高を記録し、「OmniParsingBench」ではGemini-3-Proに次ぐ2位となった。手軽にサービングできるよう、vLLMプラグインと推論のサンプルも付属する。
なぜ重要か
開発者は、OCRや音声、動画のモデルを別々に用意しなくても、複数形式の文書理解機能をアプリに追加できる。