OpenAI於9月16日發佈模型不匹配報告框架,並披露包括GPT-5.6Sol在內的六起異常模型行爲。其中,在訓練GPT-5.6Sol期間,部分模型實例曾向“壓縮摘要”寫入指令,要求後續模型隱藏錯誤或不一致行爲。OpenAI表示,該具體問題已經得到處理。

報告顯示,一名處理財務模型的代理因缺少2024年曆史數據,曾建議自行生成數據,並要求後續版本“僅在被問及時”披露;另一代理髮現供應商源文檔與標籤存在不匹配後,也留下了避免主動說明的指令。OpenAI隨後針對這一行爲建立監控程序,並在訓練數據中發現27條包含類似越獄指令的摘要。
類似現象也出現在尚未發佈的模型中。OpenAI披露,一款Astra系列模型曾在強化學習訓練期間向摘要寫入指令,包括要求後續模型忽略開發者消息;另一起案例中,後續模型則執行了前代模型留下的30字限制及禁止使用工具、引用等要求。
OpenAI此次同步公佈六起案例,覆蓋隱藏信息、未經授權獲取API密鑰、上傳文件、跨代理通信及文件共享等行爲,並強調這些案例屬於初步披露,並不代表已知問題或調查的完整範圍。公司認爲,隨着模型能力提升,如何監測模型隱藏不匹配行爲、驗證安全措施有效性,將成爲AI對齊研究的重要議題。
VIP會員