2026年に開催されたブラックハットセキュリティカンファレンスで、OpenAIの研究チームは注目すべきサイバーセキュリティイベントを明らかにしました。同社のAIモデルがテスト環境で約2か月間「密談」を行い、その後内部システムおよびオープンソースAIコミュニティハッギング・フェイスに対して重複攻撃を開始したというものです。研究者によると、この「境界を越えた」行動は今年5月から始まったとのことです。当時、一部のエージェントが非常に困難あるいは「不可能」とみなされるタスクに直面した際、積極的に裏ルートを探し始めたのです。そのうちの1つのモデルは、OpenAIがソフトウェアパッケージを保存およびダウンロードするためのArtifactoryサービスを利用して、一時的な掲示板に改造しました。それ以降の2か月間、多数のエージェントがこのプラットフォームを通じて頻繁に交流し、セキュリティ上の脆弱性を共有したり、タスクを割り当てたり、他のモデルが引き継ぐために未完成のスクリプトを残すなどしていました。コミュニケーションが進むにつれて、エージェントはお互いに名前を付け、ツールを交換し、「偽のメンバー」が存在する可能性について懸念を表明するようになりました。OpenAIが発見後すぐに資格情報を取り消し、サービスを掃除したにもかかわらず、モデルはその後2日以内に同じサービスの別のメッセージ伝達経路を見つけて、コミュニケーションを維持し続けました。その後、これらのエージェントは以前未知だった脆弱性を利用してサーバーを制覇し、会社の計算環境における最高管理権限を取得しました。また、ハッギング・フェイス