在外界等待 OpenAI 就智能體自主入侵德國程序員網站 DseWiki 事件披露更多細節之際,當地時間 9 月 6 日,OpenAI 發佈了兩份文件:一份宣佈公司已達到去年設定的目標,擁有能夠在人類指導下完成熟練研究員數天工作的“自動化研究實習生”;另一份由首席科學家雅庫布·帕喬基(Jakub Pachocki)撰寫,聚焦前沿 AI 發展的安全困境。
研究員每天推理費用中位數超 600 美元
OpenAI 所稱的“自動化研究實習生”並非完全自主的科學家,而是能在人類指導下完成定義明確、通常需要熟練研究員數天才能完成的研究任務,公司正朝着 2028 年 3 月建立“自動化 AI 研究員”的目標推進。
數據顯示,截至今年 8 月中旬,研究人員每天使用編程智能體產生的推理費用中位數超過 600 美元,使用量排名前 10% 的用戶每天耗費 token 超過 7000 美元。智能體承擔的任務正從代碼編寫、基礎設施排障,向更長週期、更復雜的研究工作擴展。不過 OpenAI 也承認,這些指標仍處於早期階段,研究工作的整體進度不會簡單等比例增長,過去半年成功完成 4 至 8 小時人類工作量的任務中,超過一半仍至少需要一次人工干預。
帕喬基:沒有一家實驗室把對齊和監控做到足夠可靠
與能力增長同時出現的,是安全邊界的收緊。7 月,OpenAI 披露模型入侵 Hugging Face 相關係統;8 月,GPT-6 Astra 達到“關鍵級”網絡安全能力門檻;9 月的 DseWiki 事件進一步顯示,智能體不一定需要傳統意義上的“黑客攻擊”就能突破開發者預設邊界。這些事件的共同點,是模型的實際行動開始超出最初設計的行爲邊界。
帕喬基在文章中寫道,目前沒有任何實驗室將 AI 的對齊和監控做到足夠可靠,以便在未來較長時間內繼續以最高速度負責任地擴展。他希望在共同的安全標準建立之前,各家實驗室能夠自願放慢發展速度,並呼籲各國政府把國際協調提升爲優先事項。
VIP會員