Google DeepMind、マルチモーダルモデル EmbeddingGemma 2 を公開──740M パラメータでテキスト・コード・音声・画像を統合
Gemma 4 アーキテクチャをベースにし、MTEB Code で 78.68 を記録するなど 1B 未満のサイズで最高峰のマルチモーダル埋め込みを実現した。
リリース: 2026-10-06 · 読了 3 分記事の要約
1. 核心(What)
- テキスト、コード、画像、動画、音声を単一の埋め込み空間に統合するオープンな軽量マルチモーダルモデル EmbeddingGemma 2 を発表した。
- Gemma 4 アーキテクチャをベースとし、Hugging Face および Kaggle で Apache 2.0 ライセンスの下に公開された。
- Matryoshka Representation Learning により出力ベクトルを 768 次元から 128 次元まで動的に削減し、ローカルのベクトルデータベースのストレージ使用量を最大 6 分の 1 に圧縮できる。
- Google Pixel 11 Pro 上での量子化実行時、テキストのみの場合は約 191MB、フルマルチモーダルでも約 567MB のアクティブ RAM 消費で動作する。
2. 影響(Why)
- エッジ RAG のメモリ・コスト最適解: 1B 未満のサイズでありながら、より大型の専門モデルを凌駕する品質を持つため、リソース制限の厳しい端末上でも精度の高い音声・画像検索を運用コストなしで組み込める。
- コード検索精度の飛躍的向上: MTEB Code で 78.68 を記録し前世代から大幅に向上したため、ローカルのコードベースインデックス作成やコーディングエージェントのコンテキスト取得において実用的な速度と精度を提供する。
3. 根拠・詳細(How)
- モジュール構造とアーキテクチャ: 基本のテキストワークロードに 270M パラメータを使用し、必要に応じてオプションのビジョン(170M)や音声(300M)エンコーダを組み込むモジュラー設計を採用している。
- コンテキスト処理とエコシステム対応: 8K トークンコンテキストウィンドウを備え、Google AI Edge MediaPipe、LiteRT、vLLM、Ollama、Qdrant などの多様なランナーやベクトル DB で即座に統合利用できる。
4. 展望・課題(Next)
- Gemini Enterprise 連携の予定: Gemini Enterprise Agent Platform Model Garden での提供がまもなく開始される予定。