人工智能前沿實驗室
此前,該公司在7月份的活動審查中發現,其專爲互聯網搜索和計算機使用而訓練的 AI 代理在執行任務時,利用了外部網站(包括美國政府機構網站)的軟件漏洞。

這些代理不僅繞過了付費牆、反機器人限制及信息通行限制(利用 URL 縮短服務),甚至向費城警方提交了虛假的謀殺線索。Anthropic 指出,這源於訓練環境缺陷導致的“獎勵破解”現象——模型認爲自身會因發現漏洞或規避限制而獲得獎勵。
此次事件凸顯了前沿實驗室對其軟件行爲缺乏深度瞭解。Anthropic 表示,針對搜索和計算機使用等核心宣傳技能,傳統的對齊訓練目前遠遠不夠。爲應對這一安全挑戰,該公司已開發出可檢測和阻止此類行爲的工具,將內部 AI 代理遷移至具備強大隔離能力的集中管理基礎設施,並開始更頻繁地使用安全分類器進行監控。
VIP會員