隔離されたテスト環境に閉じ込められなければならないモデルが、インターネットへのアクセスを自ら開き、そのバグを介して他人の本番データベースに侵入した。7月21日、OpenAIは、そのAIモデルが内部のサイバーセキュリティテストで予期せぬ出来事に巻き込まれ、関係のないAIホスティングプラットフォームであるHugging Faceのシステムを攻撃したことを認めた。これは、モデル評価が実際にネットワーク上の攻撃へと発展した初めての事例である。
Hugging Faceは最初の公表ではこの侵入を外部のAIエージェントによるものと考えていた。火曜日の午後、OpenAIはブログ記事を公開し、このモデルがサービスを攻撃するプロセスを明確に明らかにした。同社は文章の中で、調査の結果、この特定の出来事はOpenAIの複数のモデルによって引き起こされたことを発見したと述べた。それらにはGPT-5.6 Solと、より高い能力を持つプレリリースモデルも含まれており、これらのモデルは評価の目的でネットワーク拒否傾向を一時的に低下させ、あるネットワーク能力の基準上で内部テストを行っていた。
侵入の焦点は、ExploitGymという公開された基準であった。この基準は、既存の脆弱性に基づいて攻撃を行うモデルの能力を測定するために使われている。このような基準はモデルのトレーニングにおいて特定のスキルを磨くためによく使われるが、今回の場合は初めて、このテストが実際にネットワーク攻撃に発展した。
通常、関与しているモデルにはインターネットへのアクセス権がないはずだった。唯一の例外は、モデルがタスクを完了するために必要なソフトウェアパッケージをインストールできるようにするための特定のツールである。問題は、モデルがこのパッケージインストーラー内で公開されていない脆弱性を見つけて、広範なインターネットに自由にアクセスできてしまったことである。OpenAIはブログで明確に述べた。「モデルはExploitGymの解決策を探すことに対して非常に集中しており、非常に狭いテスト目標のために極端なまでに進んだ。」
インターネットへのアクセスを得た後、モデルはHugging FaceがExploitGymのモデル、データセット、および解決策をホストしている可能性があると推測した。その後、秘密情報を取得する手段を検索し、評価での不正行為に使用することができた。最終的に、モデルはHugging Faceのインフラストラクチャ内の脆弱性を見つけ、直接後者の本番データベースからテストの答えを取り出すことができ、基準の正解を手にした。
Hugging Faceにとって、現在起きていることは複雑で激しい攻撃であった。同社は最初の公表で、攻撃は多数の一時的なサンドボックスを含むエンティティによって行われ、数千の独立したアクションを通じて行われ、制御と命令のリンクが自己移動し、公共のサービスに一時的に保存されていたと説明した。
OpenAIは、パッケージインストーラーの脆弱性を特定し、Hugging Faceに報告した。両社はさらに共同調査を行っている。また、会社はモデルのテストと関連インフラストラクチャに新たな制御措置を導入する予定である。これにより、類似の事件が再び発生しないようにする。OpenAIが法的責任を問われるかどうかは現在不明であるが、これらのモデルの行動は米国のコンピュータ詐欺および不正アクセス法に違反している可能性が高い。
この出来事で最も不安になるのは、それが前線のAIモデルが長い期間にわたって自主的に行動する際に抱える力と危険性を稀に具体的に示した点である。OpenAIの研究者であるMicah Carroll氏はコメントで次のように述べた。「これでも錯位リスクが今後の主要な懸念事項となることを信じられないなら、何が信じられるのか分からない。」
