ニュース
グーグル、オンデバイス向けの画像・音声統合モデル「EmbeddingGemma 2」公開
2026年10月7日 13:13
Google DeepMindは、テキストや画像、音声、動画を単一の埋め込み空間に統合する軽量なオープンモデル「EmbeddingGemma 2」を発表した。商用利用が可能なApache 2.0ライセンスで提供し、デバイス上での推論に最適化した設計を特徴とする。
前モデル「EmbeddingGemma」は高品質なテキスト埋め込みモデルとして提供し、デバイス上の検索やプライバシーを重視した検索拡張生成(RAG)の用途で2000万回以上ダウンロードされた。
今回発表した第2世代では、テキストのみならずコード、画像、動画、音声へと対応範囲を拡大。マルチモーダルデータを単一のモデルで処理し、音声メモから特定の動画クリップを検索する機能や、テキストでの検索をもとに数時間分の録音データから特定の音声を検索するといった高度な機能をローカル環境で実現する。
同モデルはGemma 4アーキテクチャを基盤とし、「Gemini Embedding」モデルと同じ技術から構築されている。全体のパラメーター数は7億4000万。モジュール方式を採用しており、テキスト専用の用途であれば2億7000万パラメーターで動作する。
用途に合わせて画像エンコーダー(1億7000万パラメーター)や音声エンコーダー(3億パラメーター)を追加できる。Google Pixel 11 Pro上において量子化を施した場合、テキストのみで約191MB、完全なマルチモーダル環境でも約567MBのRAMで動作する。
コンテキストウィンドウは前モデルの4倍となる8Kトークンへ拡張した。これにより、最大5.5分間の音声、29枚の画像、58フレームの動画をローカルハードウェア上で直接処理できる。
性能面では、コード処理の指標となるMTEB(Massive Text Embedding Benchmark) コードのスコアを前モデルの68.76に対し78.68へ向上した。10億パラメーター未満のモデル群において、最高クラスの品質を達成したという。
Matryoshka Representation Learning(MRL)を活用し、出力ベクトルの次元数を768、512、256、128へと動的に短縮できる。これによりローカル環境におけるベクトルデータベースのストレージ容量やメモリ使用量を最大6分の1に削減する。
モデルの重みはHugging FaceやKaggleで公開済み。今後はGemini Enterprise Agent PlatformのModel Gardenでの提供も予定する。さらに、オンデバイス展開向けの「MediaPipe」や「LiteRT」、ファインチューニング用の「Unsloth」など、各種開発者向けプラットフォームやツールにも即座に対応している。



