グーグルは「地元で物を検索する」ことを、スマートフォンに収まる小さなモデルにまで実現しました。最新のEmbeddingGemma2は、自社が初めてリリースしたネイティブなマルチモーダルなオープンソース埋め込みモデルで、パラメータ数は7億4000万で、テキスト、コード、画像、動画、音声を一度に同じ意味空間にマッピングし、マルチモーダルな検索が端末側でこれほど軽く実行できるようになったのは初めてです。

最も直感的な特徴はサイズの小ささとオフラインでの使用です。完全なマルチモーダルモデルのメモリ使用量は600MB未満で、これはスマートフォン、ノートパソコン、ブラウザで直接実行でき、どこにもデータをアップロードすることなく、すべての処理が自分のデバイス内で行われることを意味します。あなたの写真アルバムや録音、動画も自分のデバイス内で検索されるため、プライバシーのハードルは自然に守られます。コンテキスト窓は8Kに拡張され、前世代の4倍であり、より長い資料を読み込んで照合することができます。言語カバーも100種類以上に拡大され、多言語間の検索も障壁ではなくなりました。

性能面では、グーグルはこのモデルが画像、動画、コードなどの検索タスクにおいて、同規模のオープンソース競合よりも顕著に優れていると主張しています。さらに親切なのはモジュール式の設計です。必要な部分のみを必要に応じて読み込むことができ、インデックスのサイズも圧縮可能で、節約されるのはスペースだけでなく演算力でもあります。現実的なシナリオにおいて、実際にできることは非常に具体的です—ローカルアルバム内で文脈に基づいて特定の写真やメディアを探し出し、長時間の動画の中で特定のセクションに直接ジャンプし、離線状態で散らばったファイルを検索したり、ローカルコードベース内で意図に応じて関数やスニペットを検索したりできます。それらをまずあるリモートサービスにプッシュしなければならないという手間はかかりません。

マルチモーダルな埋め込みモデルがスマートフォンに収まり、誰でも修正可能なオープンソースであるならば、AI検索の中心は「データをクラウドに渡す」ことから静かに「能力をデバイス内に置く」ことに移り始めています。グーグルのこの一歩は、エッジ側のプライバシー検索に新たな道を開きました。