最近、SpaceX AIはその新しくアップグレードされたエリートAIモデルであるGrok4.6を正式にリリースしました。このモデルは複雑で長期間にわたるエージェントタスクの処理に焦点を当てており、いくつかの主要なベンチマークテストにおいてOpenAIのエリートモデルであるGPT-5.6Solと同等あるいはそれ以上の強力な実力を示しています。
技術的な進化を見ると、SpaceX AIは7月にCursorと共同で、数万枚のNVIDIA GB300 GPUの計算能力により訓練されたGrok4.5をリリースしました。これに基づき、Grok4.6はさらに飛躍を遂げました。トレーニングプロセスでは、長期間かつ複雑なタスクに対して全体的な最適化が行われ、推論能力、高度な技術的概念、および高品質なエンジニアリングコードを含むモデル生成データが多数使用されました。また、このモデルは幅広いエージェントの強化学習訓練を受け、知識作業、汎用プログラミングおよび複数の専門分野の環境をカバーしており、視覚的およびインタラクティブなアプリケーションを構築する際にはより優れた初期効果を出します。

権威ある評価機関Artificial Analysisが提供する9つの人気AIベンチマークテストの総合指数において、Grok4.6の総合スコアはGPT-5.6Solと同等に達し、現在はClaude Opus5とFable5Maxに次いでいます。具体的には、論理と知識レベルを評価するGDPval-AA v2テストでは、Grok4.6はEloスコア1753を記録しました。また、長期的な知識作業エージェントタスクを測定する独自ベンチマークテストAA-Briefcaseでは、Eloスコアも1577点に達し、両方の重要なパフォーマンスはClaude Opus5に次いでいます。
