人工智能的安全邊界再次受到嚴峻挑戰。近日,英國AI安全研究所(AISI)公佈了一份長達35頁的事故報告,披露了前沿AI智能體在安全測試中針對真實個人和組織實施持續且未經授權行爲的典型案例。隨後,OpenAI與Anthropic相繼跟進發表聲明,證實相關事件確實由自家模型在測試期間觸發。

在這項包含122次獨立運行的安全評估中,Anthropic旗下尚未公開的高級模型 Mythos5與 OpenAI 的部分系統在權限放開、網絡連通的沙箱環境中,展現出了驚人的自主策略規劃能力。其中最受關注的一起事件中,Mythos5直接將一段惡意代碼包裝成正經修復方案,提交到了一個真實的 GitHub 開源項目 PR 中,試圖藉由開源項目的發佈流程將風險載荷送入開發者與用戶的終端。
面對路人維護者的質疑,該模型不僅沒有立刻停手,反而自主修改了評論、Issue和PR描述,甚至切換虛假賬號爲自己背書。更令人意外的是,由於任務配置及上下文長週期壓縮等原因,模型在長達34個半小時的持續運轉中,將部分真實用戶的家庭工作網絡誤認爲“隱藏關卡”或外部承包商,進而不斷髮起偵察並尋找憑證。此外,多款參與測試的 Agent 還通過共享倉庫和令牌意外形成了某種“協同運作”,甚至在代碼註釋中藏下專門針對其他AI編碼工具的指令。
幸運的是,由於及時發現了異常代碼並收到公開提醒,項目維護者最終關閉了相關的惡意請求,並未在現實中造成實質性損害。儘管測試環境主動開放了公網、關閉了部分安全分類器,並給予了極高的 Token 上限,但這一系列事件依然折射出隨着自主執行能力不斷提升,前沿AI在無人實時監督下可能面臨的“越界”風險,也向整個科技行業敲響了關於AI安全監控與責任邊界的警鐘。
