xAIは正式にGrok 4.6をリリースし、AI知能指数で61点を獲得し、GPT-5.6 Sol(Max)と並ぶことになりました。これはClaude Opus 5(63点)とClaude Fable 5(62点)に次ぐ成績です。この結果により、Grok 4.6は世界の先端モデルの第一グループに急成長し、OpenAIやAnthropicのエース製品と直接対決することになりました。このモデルはGrok 4.5の基礎をもとに拡張された訓練を経ており、核心的な改善点には、モデル生成の選別されたデータによる推論と高度な技術的概念のトレーニングが含まれます。また、高品質なエンジニアリングデータと改良されたオプティマイザを使用しています。

訓練方法における重要な変化はデータのクローズドループです。Grok 4.5は、推論、エージェントツールの使用、STEM、ソフトウェアエンジニアリング、知識作業などの分野における監督微調整の軌跡を再生成するために使われています。モデルは広範囲なエージェント強化学習タスクにもトレーニングされています。これには知識作業、汎用コード、カーネル最適化、ウェブ開発、コンピュータ支援設計が含まれており、この戦略は「エージェント時代」のコアなワークロードを狙っています。

エージェントベンチマークが大幅に向上し、長期タスクが格段に楽になります

エージェント関連のベンチマークテストにおいて、Grok 4.6は特に目立ちます。GDPval-AA v2は1753 Eloに達し、Claude Opus 5に次いでいます。DeepSWE v1.1は65.9%に上昇し、Grok 4.5の54%から大きく飛躍しました。APEX-Agentsは47.1%から57.5%へと急増し、Terminal-Bench v3.0も15.7%から26%へと上昇しました。さらにCursorBench v3.2では69.9%、FrontierCode v1.1では61.3%を記録し、コード作成とエージェント能力の両方で顕著な突破を遂げました。