Oossa

Google、画像・動画対応の埋め込みモデル「EmbeddingGemma 2」

Googleがテキスト、画像、音声、動画を扱う7400万ではなく7億4000万パラメータのモデルを公開。重みはHugging FaceとKaggleから入手できます。

短信著者: Oossa公開日: 1 分で読める

Googleは10月6日、テキストやコードに加え、画像・音声・動画も扱う「EmbeddingGemma 2」を発表しました。モデルの重みはHugging FaceとKaggleで公開され、商用利用可能なApache 2.0ライセンスです。

パラメータ数は7億4000万で、端末上での動作を想定しています。Googleによると、コンテキストは前モデルの4倍にあたる8Kトークンで、最大5.5分の音声、29枚の画像、動画58フレームをローカルで処理できます。

なぜ重要か

端末内で画像や音声を検索・分類するアプリを作る開発者は、公開された重みを利用できますが、実際の処理速度や対応端末の範囲は記事に記載されていません。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。