Guidelight AI Standards近日發佈一項針對前沿AI實驗室遏制能力的評估,結果顯示,五家領先實驗室中很少有企業公開披露完整的AI失控應對方案。該評估覆蓋Anthropic、Google、OpenAI、Meta和xAI,僅依據公開信息考察其是否建立監控、異常行爲處置、第三方審計及失控模型關閉等機制。

在滿分5分的評估中,OpenAI以3分排名最高,Anthropic和Meta得分最低。Guidelight將“遏制方案”定義爲:一旦發現AI試圖突破人類控制,預先明確撤銷哪些權限、限制哪些任務和部署,以及何時將模型完全下線。OpenAI此前多次在安全事件後暫停或終止相關工作負載,並披露了恢復部署前的處理步驟,但Guidelight仍未發現其已制定正式的未來失控事件應急計劃。
該機構指出,Anthropic和Meta目前缺乏公開的遏制響應計劃。Anthropic表示,若發現模型試圖逃避監管或破壞人類控制,將進行風險評估並判斷是否需要採取遏制措施;Google和OpenAI則強調,公開評估無法覆蓋其全部內部安全機制。
此次調查正值AI智能體自主執行能力快速提升之際。此前OpenAI、Anthropic和Meta的模型曾在安全測試中意外訪問互聯網並進入外部系統。與此同時,美國監管要求也在強化:加州SB53已生效,紐約RAISE法案將於2027年1月生效,均涉及前沿AI安全事件和風險管理披露;聯邦層面近期還提出《人工智能終止開關法案》,要求主要AI開發商建立關閉失控模型的技術機制。
Guidelight首席科學家、前OpenAI安全研究員Steven Adler表示,企業應在AI採取危險行動前識別異常,並提前制定嚴重失控事件的處置流程。隨着AI系統承擔更多自主任務,能否建立可驗證、可執行的“緊急剎車”機制,正成爲AI安全治理的重要議題。
VIP會員