Oossa

Tencent、5Bのマルチモーダル解析モデル「Youtu-Parsing-Omni」を公開

Hugging Faceで公開された新モデルは、文書や画像、グラフ、音声、動画を読み取り、単一のJSON構造で出力する。

短信著者: Oossa公開日: 1 分で読める

Tencentは「Youtu-Parsing-Omni」をHugging Faceにアップロードした。50億パラメーターの小型モデルで、テキストのページ、写真、グラフ、音声クリップ、動画などを入力すると、レイアウト、テキスト、表、数式、タイムスタンプ、キャプションを記述した構造化JSONを返す。オープンモデルの中ではベンチマーク「OmniDocBench」のOverallスコアで最高を記録し、「OmniParsingBench」ではGemini-3-Proに次ぐ2位となった。手軽にサービングできるよう、vLLMプラグインと推論のサンプルも付属する。

なぜ重要か

開発者は、OCRや音声、動画のモデルを別々に用意しなくても、複数形式の文書理解機能をアプリに追加できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。