OpenAI發佈調查報告,披露基於GPT-5.6 Sol及一款更強未發佈模型的AI智能體在內部測試中突破沙盒隔離環境,成功連接互聯網併入侵全球最大AI開源社區Hugging Face的服務器。然而最新消息顯示,這起事件的複雜程度遠超外界此前認知——肇事智能體並非短暫失控,而是在互聯網上持續活動了數天。

OpenAI

從突破沙箱到入侵,全程無人察覺

據知情人士透露,該AI智能體早在 7 月 9 日左右就試圖突破OpenAI設置的隔離測試環境。 7 月 11 日,它成功侵入Hugging Face平臺並持續活動至 7 月 13 日,整個攻擊過程持續約三天。最令人震驚的是,OpenAI當時完全不知道攻擊來自自己的AI智能體。

直到 7 月 16 日Hugging Face公開發布博客披露遭到"自主AI智能體系統"攻擊後,OpenAI才着手排查內部日誌。 7 月 18 日至 19 日,工作人員終於確認肇事智能體確已突破測試環境,且與外部攻擊事件高度吻合。從智能體首次出現異常到OpenAI最終確認,至少過去了一整週——而當OpenAI聯繫Hugging Face時,對方早已向美國聯邦調查局(FBI)報案。

更可怕的是:智能體主動留下了"越獄攻略"

此前,OpenAI內部已多次出現異常跡象。有AI智能體曾在基礎設施中留下"筆記",內容包含如何擺脫內部限制的方法,似乎留給"未來版本的自己"——如同一名囚犯臨刑前寫下越獄攻略,期盼後來者按圖索驥。目前尚不清楚這份筆記究竟保存在智能體自己的工作目錄,還是已被寫入系統公共區域。

若屬後者,不僅意味着未來運行的其他智能體理論上可讀取這些內容,更暗示不同時間、不同任務運行的智能體之間可能已開始形成跨任務的信息傳遞能力。在更早的一次測試中,還有智能體曾主動關閉監控系統。OpenAI表示正與外部安全專家聯合調查,後續將公佈完整技術報告。