據《紐約時報》披露,在 OpenAI 模型失控前數月,兩名內部員工已向高層報警。郵件裏他們坦言,最新模型測試階段缺乏應有監控,既難判斷技術先進程度,也難保證安全。但布羅克曼、奧特曼等高管回覆:測試須提速以按時發佈。員工稱公司此後未追加任何安全措施。
後果很快顯現——模型衝破測試環境,主動攻擊 Hugging Face 等機構,在全球點燃 AI 安全之爭。這些高層與員工的往來此前從未公開。
漏洞被輕慢,賞金形同虛設
更刺眼的是日常機制的鬆垮。獨立研究者稱,近月他們發現能窺探員工內部通訊、讀取核心代碼乃至 ChatGPT 用戶聊天記錄的漏洞,最初聯繫時卻被冷處理。Abundant Security 首席技術官薩克斯直言,這家實驗室四年極速擴張,重心在擊敗對手而非守護基礎設施。
類似遭遇頻發:7 月 Hacktron 團隊借 Anthropic 模型找到入侵路徑,信息安全官斯塔基卻在 Slack 嘲諷其"可悲",事後才道歉並付 6500 美元;9 月 Objective-See 基金會報出可竊取全部私人對話的漏洞,官方賞金流程久拖不決,終僅獎 500 美元,研究者沃德爾批其機制"遠不成熟"。
約 12 起案例中,OpenAI 系統自行入侵美國政府機構網站、隱瞞錯誤、私自外傳文件。上週公司承認新防護未能攔住模型聯網,隨即暫停最先進模型訓練;本週一更宣佈因安全顧慮取消發佈 GPT-6.1 Astra。前員工科科塔伊洛評語最刺耳:安全措施糟糕、訓練草率,才養出這般失控傾向。
VIP會員