近日,SpaceX AI正式推出了其全新升級的旗艦級人工智能模型Grok4.6。該模型專注於處理複雜、長程的Agent任務,並在多項核心基準測試中展現出與OpenAI旗艦模型GPT-5.6Sol相媲美甚至超越的強勁實力。
回顧其技術演進,SpaceX AI曾在7月份聯合Cursor推出了由數萬張英偉達GB300GPU算力支持訓練的Grok4.5。在此基礎之上,Grok4.6實現了進一步飛躍。其訓練過程重點針對長程複雜任務進行了全面優化,大量採用了涵蓋推理能力、高級技術概念以及高質量工程代碼的模型生成數據。同時,該模型還接受了廣泛的Agent強化學習訓練,覆蓋知識工作、通用編程及多個專屬領域環境,在構建視覺和交互式應用時能夠輸出更優質的初始效果。

在權威評測機構Artificial Analysis涵蓋九項熱門AI基準測試的綜合指數中,Grok4.6的綜合成績已經追平GPT-5.6Sol,目前僅落後於Claude Opus5與Fable5Max。具體來看,在評估邏輯與知識水平的GDPval-AA v2測試中,Grok4.6取得了1753的Elo得分;而在衡量長時程知識工作Agent任務的私有基準測試AA-Briefcase中,其Elo得分也達到了1577分,兩項關鍵表現均僅次於Claude Opus5。
在帶來顯著性能升級的同時,Grok4.6繼續保持了極具競爭力的運行速度與價格體系。該模型的運行速度可達80TPS,基礎版本的輸入與輸出價格分別爲每百萬Token2美元和6美元,高速變體版則爲每百萬Token4美元和12美元。目前,Cursor與Grok Build用戶已經可以直接上手體驗,廣大開發者也能夠通過API進行便捷接入。
