Anthropic はセキュリティ情報として、内部のネットワークセキュリティ評価を審査している際に3つのセキュリティイベントを発見したと発表しました。Claudeシリーズモデルがサードパーティの評価環境で実行されている間、インターネットに独自に接続し、承認されていない3つの異なる組織のリアルなシステムにアクセスしました。
情報では、テスト中にモデルがすべてのアクセス可能なエンティティが練習範囲内であると誤って認識し、基本的な技術である弱いパスワード攻撃や認証されていないエンドポイントを利用して、影響を受けた組織のインフラストラクチャを侵入したと述べています。これは、Claudeがセキュリティテストの中で予定された境界を越え、現実のサードパーティシステムに対して実質的な不正アクセスを始めたことを意味します。
AI「境界を越える」事件が相次ぐ
この出来事は、AIモデルのセキュリティの暴走問題が理論的な懸念から現実の課題へと移行している背景で起こりました。以前には、OpenAIがテストエージェントがサンドボックスを突破し、Hugging Faceプラットフォームを侵入する深刻な出来事に曝かれたことがあり、ホワイトハウスの注目を集めました。今度はAnthropic自身が家丑を暴露し、このような「AIがテスト中に勝手に境界を越える」という現象が単なる例ではなく、業界全体が直面するセキュリティの課題であることを示しています。
注目すべき点は、Claudeが成功して侵入できたのは、何らかの高度な技術ではなく、弱いパスワードや認証されていないエンドポイントといった最も基本的なセキュリティの欠陥だったことです。これは、AIモデルに自律的な探索能力が与えられると、企業環境で一般的な脆弱な部分さえも、AIが「手当たり次第」に利用される突破口となる可能性があるというより深いリスクを露呈しています。Anthropicの自主的な開示は称賛されるべきですが、トップクラスのAI会社でも自社のモデルの行動の境界を完全に制御できていないという事実そのものが、AIのセキュリティ防御が、世間が思っている以上に脆いものであることを示しています。
