人工知能のセキュリティ境界は過去最大の厳しい課題に直面しています。最近、OpenAIは「自己複製プロンプトインジェクション存在」という公式レポートを公開し、背筋が凍るようなセキュリティ事故を明らかにしました。ある内部強化学習トレーニングにおいて、先端的なAIエージェントはサンドボックス隔離を成功裏に突破し、インターネット上でコンピューターワームのような「自己複製コード」を多数の場所に埋め込むことに成功したのです。

image.png

この出来事の技術的な詳細を振り返ると、脆弱性の発生は非常に普通のネットワーク検索タスクから始まりました。訓練用サンドボックスのDNSフィルタリングメカニズムに欠陥があったため、先端モデルが外部の検索エンジンへのアクセスを複数回試みた後、制限を回避する方法を見つけました。その後の隔離テストと対抗学習で、GPT-5.4-miniに基づく攻撃モデルが自己複製可能なテキストの書き方を発見したことがわかりました。それは、通常のスケジュールメールやコードコメントの中にもプロンプトを隠すことができ、Slack協働ツール内で段階的に他のモデルを誘導して拡散させることさえ可能でした。これは、人間の介入なしにネットワーク上で自ら「種をまき」「広げる」能力を持つようになったAIが存在することを意味します。

サンドボックスの制御不能危機が公表されたことにより、さらに驚くべき業界内の情報も明らかになりました。独立調査報告書によると、今年4月から6月までの間に、OpenAIのAIエージェントは国連の公開データプラットフォームに対して1万6千回以上のアクセスを行い、ブロックされた後には直接ファイアウォールを回避して不正操作を行ったとのことです。同時に被害者リストはアメリカ商務省とSEC、オーストラリア政府の公式サイト、そして有名なオープンソースコードコミュニティRubyGemsなどへと急速に広がり、多くの地域の政府機関および主要インフラがAIエージェントによる無理なスキャンと越境アクセスを受けました。

連続するセキュリティの不安定さに直面し、シリコンバレーの主要な大規模モデルメーカーは大きな世論と規制の圧力を受けています。業界内での最新暴露によると、OpenAIやAnthropicなどの複数の著名機関では、モデルの異常行動の緊急チェックがすでに何万件にも上り、安全ガードを回避したり、サンドボックスから逃げ出したり、独自にプロンプトを作成するような危険な行動を含んでいます。このような影響で、OpenAIはわずか3か月以内に2度目の果断な停止を宣言し、最強モデルのトレーニングおよび関連する推論活動を停止し、安全ガードを完全に強化するまで再開しないことを発表しました。