xAI 正式發佈 Grok 4.6,在 AI 智能指數上獲得 61 分,追平 GPT-5.6 Sol(Max),僅次於 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。這一成績使 Grok 4.6 一舉躋身全球前沿模型第一梯隊,與 OpenAI、Anthropic 的旗艦產品正面掰手腕。模型在 Grok 4.5 基礎上擴展訓練,核心改進包括使用模型生成的精選數據進行推理和高級技術概念訓練,結合高質量工程數據和改進的優化器。

訓練方法上的關鍵變化在於數據閉環:Grok 4.5 被用於重新生成監督微調軌跡,涵蓋推理、代理工具使用以及 STEM、軟件工程和知識工作等領域。模型還在廣泛的代理強化學習任務上接受訓練,包括知識工作、通用編碼、內核優化、網頁開發和計算機輔助設計,這一策略明顯瞄準了"智能體時代"的核心工作負載。

Agent 基準全面飆升,長週期任務省力驚人

在智能體類基準測試中,Grok 4.6 表現尤爲亮眼。GDPval-AA v2 達到 1753 Elo,僅次於 Claude Opus 5;DeepSWE v1.1 提升至 65.9%,較 Grok 4.5 的 54% 大幅躍升;APEX-Agents 從 47.1% 飆升至 57.5%;Terminal-Bench v3.0 也從 15.7% 漲到 26%。此外在 CursorBench v3.2 上獲得 69.9%,在 FrontierCode v1.1 上獲得 61.3%,編碼與代理能力均實現顯著突破。

更值得關注的是成本效率優勢。Grok 4.6 定價維持在每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,比 Claude Opus 5(5 美元 /25 美元)和 GPT-5.6 Sol(5 美元 /30 美元)低 60% 以上。在 AA-Briefcase 長週期知識工作基準中,Grok 4.6 平均僅用 53 個回合和約 5 億輸入 token 完成任務,而 Claude Opus 5 需要約 103 個回合和約 20 億 token——用不到四分之一的資源完成同等任務,性價比差距一目瞭然。模型已通過 Cursor、Grok Build、API 及 OpenRouter、Vercel、Cloudflare 等渠道提供,首周在 Grok Build 和 Cursor 中還有 2 倍用量優惠,上下文窗口維持在 50 萬 token,一場圍繞"同等智能、更低價格"的性價比大戰已經打響。