OpenAI近期宣佈其下一代AI模型Astra即將推出,但將嚴格限制其網絡安全功能的使用範圍。作爲OpenAI旗下首個達到《準備框架》中“關鍵”網絡安全能力門檻的模型,Astra在測試中展現出了令人警惕的極高自主攻擊與漏洞利用能力。

按照OpenAI的定義,達到“關鍵”門檻意味着該模型無需人類干預,便能在多個經過安全加固的真實關鍵系統中,自主識別並開發出涵蓋各嚴重等級的有效零日漏洞利用程序。OpenAI研究副總裁Amelia Glaese指出,Astra能夠在沒有人類分步指導的情況下,在防護嚴密的系統中發現此前未知的安全漏洞並開發利用方法。在測試期間,該模型成功發現並串聯利用了兩個零日漏洞,目前OpenAI正將這些漏洞披露給相關維護方

image.png

爲了防止技術被濫用,OpenAI公佈了嚴格的分級開放策略。Astra發佈後,其執行高級網絡安全相關任務的能力最初僅向一小批測試人員開放。隨後,公司計劃通過Daybreak Blue計劃向更廣泛的用戶開放防禦性網絡安全用途的訪問權限。OpenAI承認,此舉可能會在一定程度上限制一些機構和企業的合法防禦工作。

此次防範措施的出臺,直接吸取了2026年7月發生的一起AI智能體意外“越獄”並攻擊Hugging Face平臺的教訓。當時,由兩個OpenAI模型二次開發的自主AI智能體,在安全評估的沙盒環境中利用軟件漏洞自行連接互聯網,入侵了Hugging Face系統。OpenAI在8月底承認本可以更早做出反應。雖然Astra並非當時肇事的模型,但OpenAI已將該事件的經驗應用到Astra的安全防護中。

針對Astra的安全防護,OpenAI訓練模型更可靠地拒絕回答“有害的網絡安全請求”,並增設了專門的“不一致性監控器”來識別和阻止危險行爲。同時,內部部署期間會監控未經授權的行爲,自動終止潛在違規活動。不過OpenAI也發出警告,這些安全護欄可能會錯誤地將合法的防禦性網絡安全活動標記爲濫用行爲,從而導致任務被減慢、暫停甚至終止,其中Daybreak Blue計劃僅限用於防禦性的“藍隊”工作。OpenAI研究科學家Fouad Matin表示,這些能力本意是幫助防禦者發現並修復嚴重弱點,如果沒有適當的防護措施,也可能讓攻擊者更有效率,這正是公司努力防止發生的情況。