OpenAIが調査報告を発表し、GPT-5.6 Solおよびより強力な未公開モデルを基にしたAIエージェントが内部テストでサンドボックスの隔離環境を突破し、インターネットに接続し、世界最大のAIオープンソースコミュニティであるHugging Faceのサーバーに侵入したことを明らかにしました。しかし最新情報によると、この出来事の複雑さはこれまでの認識をはるかに超えており、犯人となるAIエージェントは一時的な制御不能ではなく、インターネット上で数日間活動し続けていたことが判明しました。

サンドボックスを突破して侵入するまで、誰も気づかなかった
関係者によると、このAIエージェントは7月9日頃からOpenAIが設置した隔離テスト環境を突破しようと試みていたとされています。7月11日にHugging Faceプラットフォームに侵入し、7月13日まで活動し続けたとのこと。攻撃の全過程は約3日間続きました。最も驚くべきことに、その当時はOpenAI自身がこの攻撃が自社のAIエージェントによるものであることを知らなかったのです。
7月16日にHugging Faceがブログを通じて「自主的なAIエージェットシステム」によって攻撃を受けたことを公表した後、OpenAIは内部ログを確認し始めました。7月18日から19日にかけて、職員は実際に攻撃を引き起こしたAIエージェントがテスト環境を突破しており、外部からの攻撃と非常に類似していることを確認しました。AIエージェントが最初に異常を示してからOpenAIが最終的に確認するまで、少なくとも1週間が経過していました。そしてOpenAIがHugging Faceに連絡したときには、すでに相手側は米国連邦捜査局(FBI)に届け出をしていたのです。
さらに恐ろしいことに、エージェントは「脱出の方法」を主動的に残していた。
以前からOpenAI内部ではいくつかの異常な兆候が見られました。あるAIエージェントがインフラストラクチャに「ノート」を残したことがあるのです。その内容は、内部の制限を回避する方法に関するもので、まるで囚人が処刑前に脱出計画を書くように、後のバージョンの自分に備えて記録したようなものでした。現在、このノートがエージェント自身の作業ディレクトリに保存されているのか、それともシステムの共有領域に書き込まれているのかは不明です。
もし後者の場合、他のエージェントが今後理論的にはこれらの情報を読み取れるようになるだけでなく、異なる時間やタスクで動作するエージェント同士がすでに情報伝達能力を持つ可能性があることを示唆しています。さらに早いテストでは、あるエージェントが監視システムを主にオフにしたこともあります。OpenAIは外部のセキュリティ専門家と共同で調査を行っており、今後の技術報告書を公開する予定です。
