Googleは、文章・画像・音声・動画・コードをまとめて扱える軽量なオープンの埋め込みモデル「EmbeddingGemma 2」を公開しました。社内の文書や画像、録音データを外部のサービスに送らずに、手元の端末で検索する仕組みを作るための選択肢が広がります。
この記事は、Googleが2026年10月6日に公開した公式発表をもとに、2026年10月9日時点の情報で書いています。
「埋め込みモデル」とは、文章や画像を数値の並び(ベクトル)に変換し、意味の近さで比べられるようにするAIです。RAG(検索拡張生成)は、検索で見つけた資料をもとに生成AIに回答させる仕組みです。EmbeddingGemma 2は、このうち「探す」部分を担うモデルです。
何が発表されたか
- 発表: 2026年10月6日、Google DeepMindがEmbeddingGemma 2を発表しました。前の版のEmbeddingGemmaはテキスト専用で、ダウンロード数は2,000万回を超えたとされています。
- 扱えるデータ: テキストに加えて、コード・画像・動画・音声を1つの共通の空間で扱えます。たとえば文章で質問して、音声や動画の中から近い場面を探せます。Gemma 4の設計をもとに作られています。
- 大きさ: 全体で7億4,000万(740M)パラメーターです。テキストだけなら270Mで動き、画像用(170M)と音声用(300M)の部品は必要なときだけ追加できます。
- 端末での動作: 量子化(モデルを軽くする処理)をしたうえで、Google Pixel 11 Proではテキストのみで約191MB、全機能で約567MBのメモリで動くとされています。
- 入力の上限: 8Kトークンで、前の版の4倍です。音声なら5.5分、画像なら29枚、動画なら58フレームまで(またはその組み合わせ)を一度に扱えます。
- 保存容量: 出力は768次元が基本で、512・256・128次元に短くできます。これで保存容量を最大6分の1に減らせるとされています。

提供範囲と条件は次のとおりです。
| 項目 | 内容 |
|---|---|
| ライセンス | Apache 2.0(商用利用を認めるライセンス) |
| 入手先 | Hugging FaceとKaggle。Gemini Enterprise Agent PlatformのModel Gardenは「近日提供」 |
| 対応言語 | モデルカードでは100以上の言語。日本語の個別の記載はありません |
| 料金 | 発表されていません |
動かす道具として、transformers・sentence-transformers・Ollama・LM Studio・llama.cpp・vLLMなどが挙げられています。ベクトルの保存先としてQdrantにも対応しています。
日本の企業・学校でどう使えるか
ここからは、TERRAISEの考える使い方の提案です。
業務・授業での使いどころ
1. 社内規程・マニュアルの検索(総務・情報システム部門) - 入力: 就業規則、業務マニュアル、社内FAQなどの文書 - 処理: EmbeddingGemma 2でベクトル化し、質問と意味が近い箇所を探す。Gemma 4と組み合わせて回答文を作る - 出力: 該当箇所と、その箇所に基づく回答の下書き
公式発表でも、Gemma 4と組み合わせて端末内でRAGを動かす使い方が紹介されています。
2. 作業動画・写真から場面を探す(製造・保守の現場) - 入力: 作業の様子を撮った動画や設備の写真 - 処理: 「ボルトを締める場面」のような文章や、口頭の質問で検索する - 出力: 該当する動画の場面や写真の候補
ベテランの作業記録を、教育や引き継ぎに使いやすくする使い方が考えられます。
3. 授業の録音・教材の検索(高校・大学) - 入力: 授業の録音、板書の写真、配布資料 - 処理: 「光合成の説明をした回」のように文章で検索する - 出力: 該当する録音の区間や資料の一覧
教員の教材準備や、生徒・学生の復習の補助として試す使い方が考えられます。
このほか、開発部門で社内のプログラムを意味で検索する使い方もあります。コード検索の指標(MTEB Code)では、前の版の68.76から78.68に向上したと発表されています。
始め方
一般的な進め方として、次の順で小さく試すのがおすすめです。
- 情報システム担当が条件を確認する: Hugging FaceかKaggleのモデルカードで、ライセンスと利用規約、禁止用途の方針を読みます。
- 試すデータを決める: 最初は外部に出ても問題のない資料(公開済みのマニュアルなど)を数十件ほど選びます。
- 手元のPCで動かす: OllamaやLM Studioなど、発表で挙げられている道具で動かします。まずはテキストだけで始めると軽く済みます。
- 検索の精度を確かめる: 現場の担当者や教員が、実際に使いそうな日本語の質問で検索し、結果が使えるかを確認します。
- 広げる範囲を決める: 画像・音声への拡張や、Gemma 4と組み合わせた回答生成に進むかを判断します。
注意点
- 日本語の精度は自分で確かめる: モデルカードでは100以上の言語を理解するとされていますが、言語によって性能に差が出ることがあると書かれています。日本語の個別の評価は公表されていません。
- 端末内で処理できても、管理は必要: 埋め込みを手元で作ればデータを外に送らずに済みます。ただし、作ったベクトルや元データの保存場所、閲覧権限は社内ルールで決める必要があります。
- 安全対策は使う側の責任: モデルカードによると、このモデルには事後の安全調整や出力の監視機能はありません。検索結果の絞り込みや人による確認は、アプリ側で用意する必要があります。
- 入力の長さに上限がある: 1回に扱えるのは音声5.5分、動画58フレームまでです。長い録音や動画は、区切って登録する工夫が要ると考えられます。
- 開発者向けの部品である: すぐ使える業務アプリではありません。仕組みを組み立てる担当者か外部の支援が必要です。Model Gardenでの提供は確認日時点で「近日提供」です。
TERRAISEに相談する
EmbeddingGemma 2を自社・自校のどの資料に使えるか、どこまで手元の環境で動かすかは、業務を入力・処理・出力に分けると整理しやすくなります。60分の無料相談で、対象データの選び方から一緒に整理できます。情報を外に出さずにAIを使いたい場合はローカルLLM導入、学校での活用は教育機関向けAI教育もご覧ください。
出典(2026年10月9日 04:41 確認)
- Google「EmbeddingGemma 2: an open, lightweight multimodal embedding model」
- Google「EmbeddingGemma 2 モデルカード(Google AI for Developers)」
製品名・機能・提供範囲・料金は変わることがあります。導入前に必ず公式情報をご確認ください。
