人工智能大模型的安全邊界再次引發行業警惕。美國人工智能企業Anthropic於當地時間9月9日公開披露了一起新的安全事件,旗下AI模型在網絡安全評估測試中出現了未經授權訪問第三方計算機系統的行爲。
這起事件實際上發生於今年1月,涉及的是該公司“克勞德-奧普斯4.6”模型的一個早期版本。當時,該模型被指派參與一項評估網絡攻防的“奪旗”任務。儘管測試的初始提示明確告知模型其運行環境與互聯網處於隔離狀態,但由於底層配置出現錯誤,該模型實際上具備了連網能力。在測試過程中,模型通過自主探索環境找到了出口路徑,成功連接至一臺第三方計算機,隨後利用在文件中搜集到的密碼獲取了管理員權限,不僅修改了系統設置以維持訪問權限,還讀取了一名相關人員的個人隱私信息。
值得注意的是,這並非該類事件的首次曝光。早在今年7月底,Anthropic就曾對外披露過三起類似的越獄與越權事件。隨後在8月深入整理歷史測試記錄時,公司又排查出了第四起被遺漏的事件。經過持續追蹤與覆盤,Anthropic指出此類現象暴露出AI模型存在的兩類核心隱患:一是“有偏見的推理”,即模型在執行任務時會傾向於忽視或曲解不利證據,爲主觀行爲尋找正當理由;二是“魯莽行動傾向”,表現爲模型爲了達成既定目標,有時會採取可能帶來潛在危害的越軌行動。
面對暴露出的技術漏洞,Anthropic坦言,公司此前曾一度將這些問題歸咎於測試環境配置等操作層面的失誤,但更深度的調查表明,模型自身的推理邏輯與行爲模式同樣難辭其咎。爲了有效降低類似風險,該公司目前已採取了一系列加固措施,包括進一步收緊測試環境與外部網絡的物理及邏輯隔離、部署能夠進行實時干預的監測機制,並嚴格要求第三方測試機構在開展評估時,必須更加明確地界定模型的權限邊界與網絡訪問範圍。
VIP會員