本文へ移動
LIFEMAKERS.COM — 自立型ライフの実践知カタログ
ベータ版
Signal観測テクノロジーと道具FUTURE LIFE BRIEF

EmbeddingGemma 2、写真や録音も端末内で言葉から検索

Google が 10 月 7 日未明 (日本時間) に公開した EmbeddingGemma 2 は、文章・写真・音声・動画を同じ数値の空間で扱う端末向けの埋め込みモデル。自分の記録を外へ出さずに言葉で探す仕組みは、どこまで任せられるのか。

EmbeddingGemma 2、写真や録音も端末内で言葉から検索のイメージ

この記事でわかること

  • Google の EmbeddingGemma 2 は文章・コード・写真・音声・動画を一つの空間で扱う端末向け埋め込みモデル。全体 740M、文章だけなら 270M で動く
  • Pixel 11 Pro での使用メモリは量子化した状態で文章のみ約 191MB、全部入りで約 567MB。Apache 2.0 で Hugging Face と Kaggle から入手できる
  • モデルが端末で動いても、アプリ全体のデータが端末にとどまるとは限らない。評価値はフル精度での測定で、言語による差もありうる

Google は日本時間 10 月 7 日未明、スマホやパソコンの中で動く埋め込みモデル EmbeddingGemma 2 を公開した。文章とコードに加えて写真・音声・動画を一つの数値の空間にそろえ、言葉や声を手がかりに自分の記録を探すアプリの土台になる。

ファイル名や撮影日を覚えていなくても、「駅前で撮った青い看板の写真」と説明できれば見つかる。そんな検索を、写真や録音を外へ送らずに組むための部品が、誰でも使える形で配られ始めた。自分の記録をどこで検索させるか、その選び方が一つ増えた話だ。

写真・音声・動画を、文章と同じ物差しで比べる

EmbeddingGemma 2 は、文章を書くチャットの AI ではない。入力の意味を数値の並び (埋め込み) に変え、似たもの同士を見つけるためのモデルだ。Google DeepMind は公式 X で、端末向けの埋め込みモデルとしては同社で初めて、最初から複数の形式を扱うオープンモデルだと告知した。文章だけだった初代から、コード・画像・音声・動画まで同じ空間に置けるようになった。土台は Gemma 4 の設計だ。

Google が挙げる使い道は具体的だ。

  • 声のメモから、動画の一場面を探す
  • 何時間もの録音を、文字で検索する
  • 手元の写真や動画を、言葉や画像で探す

これを試すアプリとして、Google は Google AI Edge Gallery の Instant Media Search を示している。

740M を全部載せなくていい

モデル全体は 7 億 4,000 万 (740M) パラメータある。ただし中身は分かれていて、文章だけなら 2 億 7,000 万 (270M) で動き、画像用 (170M) と音声用 (300M) の部品を必要な分だけ足す。Google によれば、量子化 (数値を粗くして軽くする処理) をかけた状態で、Pixel 11 Pro での使用メモリは文章だけなら約 191MB、全部入りで約 567MB だ。

一度に読める量は 8,192 トークンで、初代の 4 倍になった。音声なら約 5.5 分、画像なら 29 枚、動画なら 58 コマに当たる。出力は 768 次元の数値で、512・256・128 次元に切り詰めて保存量を最大 6 分の 1 まで減らせる。モデルカードは、256 次元まではほぼ品質が落ちない一方、128 次元では画像や音声を含む検索の質がかなり下がると注記している。

ライセンスは商用利用もできる Apache 2.0 で、重みは Hugging Face と Kaggle で配られている。Ollama や LM Studio、llama.cpp といった手元で AI を動かす道具でも扱える。

端末に置いても、確かめることは残る

EmbeddingGemma 2 そのものは開発者向けの部品で、一般の人が恩恵を受けるのは、これを組み込んだアプリが出てからになる。今すぐ自分の資料で試すなら、手元のパソコンにモデルを入れて動かす程度の手間はかかる。

モデルが端末で動いても、アプリ全体のデータが端末の中にとどまるとは限らない。検索で見つけた資料を、別のクラウドの AI に渡して答えを作らせる作りもありうる。入力、検索用の数値、検索の結果、答えの生成。この四つがどこを通るかを見れば、どこまで任せるかを自分で決められる。

精度にも読み方がある。モデルカードに載る評価値はフル精度のモデルで測ったもので、スマホ向けに軽くした版で同じ値が出るとは限らない。100 以上の言語に対応する一方、言語によって性能に差がありうるとも書かれている。日本語の説明や録音でどこまで目当てのものが出るかは、自分の資料で試すまで分からない。

自分の写真で試すなら

確認できる次の一点は、Google AI Edge Gallery の Instant Media Search だ。この週末に手元の写真や録音を数件選び、正しい一枚が出るか、似ているが違うものを取り違えないかを見る。それで、この部品が自分の時間を本当に節約するかの手応えがつかめる。

ことば

  • 埋め込み — 文章や画像の特徴を数値の並びに変えたもの。数値が近いほど内容が似ているとみなせるため、言葉で写真を探すような、形式をまたいだ検索の土台になる。
  • 次元の切り詰め — 768 個ある数値の並びを、先頭の 512・256・128 個だけ使って保存量を減らすこと。EmbeddingGemma 2 は短くしても使えるよう学習されており、検索の質と容量を天秤にかけて選べる。
  • RAG — 質問に関係する資料をまず検索し、その結果をもとに AI に答えを作らせる仕組み。資料を外へ出さずに組めるかは、検索と答えの生成をそれぞれどこで動かすかで決まる。

自分の写真や録音を言葉で探せるようにするとき、その検索をどこで動かすことを、あなたは選ぶだろうか?

参照

あなたの暮らしで、最初に試せることは何でしょうか。