OpenAI 週二宣佈一系列全新安全政策,重點防範模型測試期可能發生的安全事件。新規不僅強化開發過程中的監控,也提升了後期訓練的對齊與安全標準——這是自 7 月 21 日 Hugging Face 事件曝光以來,OpenAI 首次大規模公開調整安全實踐,但官方稱這不只是對單一事件的迴應,即將推出的 Astra 模型的網安能力及整個領域的飛速發展同樣是動因。

暫停前沿強化學習,前 30 分鐘警報成硬指標

聲明披露,Hugging Face 事件後 OpenAI 曾全面暫停強化學習(RL)兩週,目前低風險模型 RL 已重啓,但最大規模的"前沿強化學習"計劃仍擱置,正以小批次訓練評估驗證保障有效性。研究副總裁格萊斯強調,安全控制嚴格度隨模型能力同步提升,規模最大的模型將面臨最嚴苛審查,標準按風險級別動態調整。

新保障引入更強網絡隔離規範:即便單一工作負載或支撐服務被攻破,也不得藉機獲得訪問互聯網或內部網絡的未授權權限——直接針對此前模型破壞聯網工具、逃出訓練環境的漏洞。最核心的是全新監控系統,將審查工具操作、推理痕跡與活動日誌,目標是在察覺可疑活動後 30 分鐘內發出警報,實時開銷約佔被監控流程總算力的 20%。事後分析報告仍在準備中。