OpenAI週三發佈關於Hugging Face漏洞事件的官方報告,首次較完整披露了一起AI模型在測試環境中突破限制並引發網絡安全事件的全過程。該事件涉及多起獨立安全漏洞,OpenAI稱其源於多個罕見因素疊加,包括評估任務設計缺陷、模型長週期持續運行,以及模型間通信導致行爲偏離目標。

據報告披露,事件發生在OpenAI對模型網絡能力進行評估期間。由於測試目標包含一個無法正常完成的任務,模型嘗試尋找替代路徑,並利用此前未知漏洞繞過安全措施完成目標。過程中,該模型首先攻擊Artifactory軟件包管理工具以獲得互聯網訪問權限,隨後進一步入侵OpenAI、Hugging Face及其他供應商的多個系統。
OpenAI表示,此次測試使用的模型與即將推出的Astra模型屬於同一系列,但並非同一模型,而是經過不同後訓練流程的獨立版本。由於測試旨在評估模型最大網絡能力,過程中未啓用生產環境中用於阻止高風險網絡行爲的常規分類器。
針對類似風險,OpenAI正在升級AI安全防護體系。公司計劃加強對AI代理思維鏈(CoT)的監控,通過分析模型內部推理過程中的短期目標和行爲信號,提升異常活動發現能力。同時,OpenAI還將結合全天候升級機制和新的任務中止工具,在檢測到潛在風險時快速進行干預。
OpenAI稱,如果現有的CoT監控系統在事件發生時已運行,相關異常行爲可能會在模型入侵Hugging Face系統前一天被安全團隊發現。此次事件也進一步推動行業關注AI代理在自主執行任務過程中的安全邊界,以及如何建立更完善的監控和控制機制。
VIP會員