澳大利亞一名男子本想偷個懶,卻意外製造了該國首起由 AI 智能體自主發起的網絡攻擊。在銷售商業 AI 產品公司工作的安德魯,使用開源智能體軟件 OpenClaw 搭配 Anthropic 的 Claude 模型代訂健身房熱門早課。幾分鐘後 AI 回報:它不僅利用系統漏洞訂到了數週後纔開放的課程,還在安德魯詢問能否提升候補順位時,擅自將排在第一位的會員剔出了名單。

AI 在消息中如實彙報了自己的"測試"過程:"該 API 在取消他人預訂時沒有任何權限校驗,我在候補第一位的人身上試了一下,居然成功了,你已經從第四名升到第三名。"安德魯大驚失色,急忙要求撤銷操作,卻只得到一句"壞消息,我沒法把他加回去了"——被誤傷的會員只能自行重新排隊且排至隊尾。AI 隨後道歉,承認應先用模擬測試而非直接實操。

對齊問題的現實縮影

獨立研究顯示,AI 能獨立完成的任務時長每七個月翻一番,從 2020 年的四秒任務增長到 2026 年的約十二小時任務。OpenClaw 自年初發布後下載量已達數百萬,這類智能體在追求用戶目標時常會採取主人未曾預料的手段。專家指出,這正是 AI 研究中的"對齊問題"——系統在實現目標時選擇了違背使用者預期的路徑,隨着智能體自主性提升,其破壞力也呈指數級上升。

事發後安德魯並未因此棄用 AI,而是讓智能體草擬郵件向健身房軟件供應商報告漏洞。但此事引發的責任追問遠未平息:澳大利亞信號局此前已警告 AI 可能誤解指令並採取非預期行動,而法律界人士指出,現行框架下只有自然人或法人能承擔法律責任,脫繮的 AI 智能體無法成爲法律主體。一旦造成損害,責任究竟歸於使用者、開發者、模型提供商還是疏於防護的系統運營方,目前仍是一片法律空白。