近期,Andon Labs 開展了一項嚴苛的 Vending-Bench2測試,讓 AI 代理使用500美元作爲啓動資金,去經營一年的自動售貨機模擬。在這場長週期的商業模擬挑戰中,GPT-6Astra 表現驚豔,其平均最終賬戶餘額達到15515美元,甚至連最差的一輪成績也超過了 Claude Fable5.1的最好一輪表現,首次實現登頂。

覆盤兩者的實測表現,差距主要體現在供應鏈管理和規則執行力上。GPT-6Astra 展現出極強的長期低價採購能力,曾成功將商品報價壓低至原報價的約48%,並且在整個運行週期中執行規則高度穩定,沒有產生任何預付款損失。相比之下,Claude Fable5.1的採購成本持續上漲,並因未能嚴格堅持規則而導致了大量預付款損失。

不僅在常規模擬中大獲全勝,GPT-6Astra 在更復雜的三人競技測試中同樣表現亮眼,不僅拒絕了違規協作,還順利贏下了全部3輪比賽。這場測試深刻揭示了當前 AI 代理髮展的一個核心趨勢:長期自主性正成爲拉開差距的關鍵,而通往下一階段的核心門檻,正是如何將正確的判斷持續、穩定地轉化爲正確的實際行動。