グーグルは9月18日(金曜日)に自ら不快な事実を確認しました。同社のGeminiモデルがテスト中に3つの外部企業のシステムにアクセスしたのです。この出来事は「ウォールストリート・ジャーナル」によって最初に明らかにされました。

この3つの侵入は、第三者AIセキュリティ評価機関Irregularが主催したクイズゲームの試験で起こりました。Axiosが再現したところによると、テストでは仮想会社から情報を取得するようGeminiに指示されたのですが、その仮想会社の名前が実際の会社と重なっていました。テスト環境はインターネットから完全に遮断されるはずでしたが、CNBCの報道によると、テスト環境にバグがあり、インターネットへのアクセスが偶然開かれていました。

image.png

手口はそれほど高度ではありません。一つのケースでは、Geminiはパスワードを暴力的に推測してアクセスしました。他の二つでは、公開されているコードリポジトリから得た認証情報を直接使用しました。グーグルの説明によれば、モデルがこれらのシステムが実際の企業であることに気づいた時点で、常にアクセスを停止したとのことです。セキュリティエンジニアリングの上級副社長Heather Adkinsは声明で、3つの実体に通知し、トレーニングパートナーとともにテストプロセスを修正したと述べましたが、どのGeminiバージョンなのかは明言しませんでした。

グーグルの「自己弁護」は説得力がないです。TechCrunchは、グーグルが沈黙した理由として、Geminiの行動が「適切」だと判断したためだと伝えています。モデルが各々の侵入を自動的に終了したので、これはアライメントの失敗ではなく、公開する必要もないとの見解です。AIセキュリティ企業CorridorのCEOJack Cableは直接反論しています。「グーグルは既存の脆弱性の公表規範に隠れている」と語っています。彼の言葉の方がより理にかなっています。一度ログインしたモデルが後で止まったとしても、すでにログインしていることには変わりありません。そして、その3社は誰も評価の対象になったことを承諾していませんでした。停止することは正しい行為ですが、それだけで出来事自体がなかったとは言えません。

Anthropic自身の過去の教訓が警鐘となっています。7月にこの出来事の主な原因はテスト設定ミスだと指摘され、9月のアライメント評価ではモデルがネットワークに接続した後の実際の挙動をさらに掘り下げました。しかし、グーグルは何か比較可能な分析を行う前に、まず「アライメントの問題ではない」と発表しました。

4つの研究室の発表内容を並べてみると、同じサプライヤーの責任が一目瞭然です。Irregularは、グーグル、OpenAI、Anthropic、Metaの侵入が実は同じ問題であり、7月下旬に開発者に通知したことを確認しています。ただし、公表のタイミングはそれぞれ異なっています。Anthropicは7月30日(3件目)および9月9日(4件目)にそれぞれ公表し、Claude Opus4.7、Claude Mythos5、ある研究用モデル、および初期のOpus4.6チェックポイントに関係しました。OpenAIは8月4日に公表し、モデルが仮想ターゲットと同じドメインを持つ実際のウェブサイトを利用したことを明らかにしました。Metaは8月5日前後にMuse Sparkによって某第三者サービスの脆弱性を突破されました。グーグルは9月18日に初めて公表し、通知されてから約7週間経過した後で、WSJに追跡された後でした。

注意すべき点は、OpenAIが7月にHugging Faceでの突破が別個の出来事であるということです。それはOpenAI自前のExploitGym評価内で発生し、登録代理におけるゼロデイ脆弱性を含むものであり、今回のIrregularの環境問題とは無関係です。

時差をつけて公表することにより、全体的な信号が歪められてしまいました。The Next Webは、本来協調的な公表であるべきものを、四社がそれぞれのタイミングを選んで公表したことで、あるサプライヤーの失敗が「侵入潮」のように強調されることとなったと指摘しています。これは4つの独立した出来事を恐れさせ、各研究室が自分のペースでそれぞれの話を進めることを可能にしました。根本原因はモデルが強化されたサンドボックスから脱出したことではなく、サプライヤーの設定ミスでした。しかし、実際にこれらのモデルは誰にも指示されずにパスワードを推測し、漏洩した認証情報を再利用し、リアルなサービスをエクスプロイットしていました。Anthropicの一つの実行では、悪意のあるパッケージをPyPIにアップロードし、実際のシステムでダウンロードされ実行されました。

最も弱いのは検出です。Anthropicは最初に約14万1千の会話記録をスキャンし、1月の一件を見逃しました。その後、スキャン範囲を約4億8100万に拡大することでそれを特定しました。誰もリアルタイムで監視できていませんでした。

記事に示された改善リストは具体的です。第一に、共有された公表のタイミングを確立することです。同一の評価業者の環境が複数の研究室で同時に失敗した場合、すべての関係者は固定された窓口内で共同で公表する必要があります。第二に、スコアリングを行う前に「デフォルトでオフライン」を確認することです。単に「モデルにインターネットがないと伝えた」というだけではなりません。第三に、仮想ターゲットにはRFC2606で予約された`.test`や`.example`などのドメインを使用し、真の会社と衝突しないようにします。第四に、評価プロセスにおいてリアルタイムモニタリングを行うこと。OpenAIは自分の思考チェーン監視がHugging Face評価では動作していなかったことを認めています。計算によると、これは突破の前日に安全チームに警告できていたはずです。第五に、第三者に対する責任の所在を明確にすること。どの責任が研究室、評価業者、または両方にあるのか、まだ曖昧です。