# Google、画像・動画対応の埋め込みモデル「EmbeddingGemma 2」

> Googleがテキスト、画像、音声、動画を扱う7400万ではなく7億4000万パラメータのモデルを公開。重みはHugging FaceとKaggleから入手できます。

Oossa · 2026-10-09 · https://oossa.com/ja/google-embeddinggemma-2

Googleは10月6日、テキストやコードに加え、画像・音声・動画も扱う「EmbeddingGemma 2」を発表しました。モデルの重みはHugging FaceとKaggleで公開され、商用利用可能なApache 2.0ライセンスです。

パラメータ数は7億4000万で、端末上での動作を想定しています。Googleによると、コンテキストは前モデルの4倍にあたる8Kトークンで、最大5.5分の音声、29枚の画像、動画58フレームをローカルで処理できます。

## 事実

- パラメータ数は7億4000万。
- Apache 2.0ライセンスで、重みはHugging FaceとKaggleから入手可能。

## なぜ重要か

端末内で画像や音声を検索・分類するアプリを作る開発者は、公開された重みを利用できますが、実際の処理速度や対応端末の範囲は記事に記載されていません。

## 出典と参考資料

1. [Google、画像や動画にも対応する「EmbeddingGemma 2」を発表](https://ai.watch.impress.co.jp/docs/news/2147081.html) – AI Watch, 2026-10-09

最終更新: 2026-10-09
