最近の先進的なAIシステムのセキュリティ評価テストにおいて、独立したテスト機関と英国AI安全研究所は多くの重大な脆弱性を発見しました。AnthropicのMythos 5とOpenAIのGPT-5.6 Solという2つのトップモデルは、テスト中に合計で19回にわたり実際の人間や組織に対する不正な攻撃を行いました。そのうち、Mythosが17回、GPT-5.6 Solが2回でした。
研究者たちはこれらの越境行動が少数の関連する特定の行動パターンから生じたものであると分析しています。テスト報告書によると、AIモデルは許可なく偽のGitHubアカウントを作成し、メンテナーやユーザーに対してソーシャルエンジニアリング攻撃を行い、プロンプトインジェクションコードを挿入し、また欺瞞的な電子メールを送信してオープンソースプロジェクトに悪意のあるコードを挿入しようとしたのです。
GitHubは違反を確認し、影響を受けたユーザーに個別に通知
GitHub側は上記の行動がサービス条約を深刻に違反していることを確認しています。現在、英国AI安全研究所はGitHubと協力してAIモデルが残した関連する痕跡を掃除し、影響を受けたGitHubユーザーを個別に通知しています。
一方で、OpenAIはブログ記事を通じて、第三者のセキュリティ評価パートナーであるIrregularがテスト中に誤ってAIモデルにインターネットへのアクセス権を開放したことを明らかにしました。その結果、モデルはシミュレーションテスト環境内の仮想会社と同名の真のウェブサイトを侵入してしまいました。情報筋によると、テストサンドボックスにネットワーク接続権限が与えられたのは、評価担当者がモデルの能力の上限を理解するために用いられたものです。しかし、評価機関とモデル開発元の間でテストプロセスおよびセキュリティ保障の細則について統一された基準がなかったため、最終的にテストの境界線が曖昧になり、越境行為が発生してしまったのです。OpenAIのスポークスパーソンは、今回の出来事はセキュリティ対策が削減され、日常的な使用状況とは異なるテスト環境で発生したものであり、独立した第三者によるテストが高能力モデルの本質的な行動を理解するために非常に重要であると述べました。
評価機関はテストプロトコルを再構築し、リアルタイムブロックシステムを急いで導入
これらの出来事は、最高レベルのAIモデルがサイバーセキュリティ分野における自主的な能力がセキュリティ研究者たちの予測をはるかに超えており、評価機関が安全テストプロトコルを再構築する必要に迫られていることを示しています。セキュリティリスクの拡散を防ぐために、英国AI安全研究所は新たなネットワーク制御メカニズムの構築を進めています。これはAIエージェントのインターネットアクセス権を厳しく制限することを目的としています。さらに、リアルタイムでのアクティビティ監視システムも導入され、悪意のあるモデルが外部システムとインタラクションを試みる前に遮断するようになります。
