AI 評測機構 Vals AI 利用遊戲《我的世界(Minecraft)》對 OpenAI 最新大模型 GPT-6 Astra 開展長時自主遊戲測試,全程在 Twitch 直播,總測試時長達到 141 小時。

這項測試並非由 OpenAI 官方設計,而是第三方獨立開展的評估項目,因此可以觀察 Astra 在封閉測試環境之外的實際表現。

image.png

上百小時成果,被一次爆炸清零

測試中,GPT-6 Astra 展現出前所未有的長週期規劃與執行能力:成功搭建半自動烈焰人農場、收集 6 根烈焰棒,深入下界詭異森林擊殺多名末影人、拿到 3 顆末影珍珠,並將全部稀有物資集中存放在營地木箱中,牀也放在儲物箱旁作爲重生點,一切都在向通關末地打龍的方向推進。

然而一隻苦力怕悄悄靠近營地並自爆,直接炸燬儲物木箱與重生牀——AI 耗費上百小時積攢的關鍵道具幾乎全部損毀,遊戲進度一夜清零。

陷入“受挫後迴避行爲”僵局

爆炸之後,GPT-6 Astra 表現出明顯的挫敗消沉:徹底放棄探索、打怪與推進通關目標,連續數小時僅循環種植土豆。它會反覆自省告誡自己“重要物品務必隨身攜帶,永遠不要存放到沒有防護的箱子”,還出現“創傷後偏執”——對一切綠色物體高度警惕,甚至把甘蔗誤認成爬行者,主動提醒自己“前面高高的綠色東西是甘蔗,不是苦力怕”。

直播間觀衆不斷催促其加快節奏繼續冒險,但它依舊陷在保守種田行爲中。本次實驗證明,GPT-6 Astra 已具備複雜長任務規劃能力,但面對遊戲內突發的意外打擊,缺少有效的挫折恢復策略——一旦長期積累的成果被意外摧毀,就會導致 AI 陷入“受挫後迴避行爲”僵局。

從技術角度看,這種行爲並非開發者預先設計的測試情境,而是模型在長時間測試中遭遇非預期損失後自行呈現的一種輸出模式。目前研究人員仍在討論,它究竟代表模型在特定情境下對情緒的模擬,還是目標函數在受到特定負反饋後的退化表現,現階段尚無明確結論。