ByteDanceのSeedチームと清华大学スマートインダストリーアカデミー(AIR)は、最近新たにシステム「CUDA Agent」を正式に発表しました。これは、高性能なGPUコアを生成するための大型言語モデルを訓練するための知能エージェント強化学習システムであり、AIが下位コード最適化分野において重要な進展を遂げたことを示しています。
過去のAI開発において、最先端の大規模モデルは文法的に正しいCUDAコードを生成できるものの、生成されたコードの効率が低いため、実際の実行速度で従来のコンパイラを上回ることができませんでした。KernelBenchのベンチマークテストを例にすると、基本モデルのSeed1.6ではタスクの通過率は74.0%に達したものの、torch.compileを上回る割合は27.2%にとどまり、平均的な幾何的スピードはコンパイラ自体より劣っていました。
このボトルネックを突破するために、CUDA Agentは大規模モデルを現実的なCUDA開発環境に配置し、パフォーマンス分析ツール、正しさを検証するメカニズム、および権限保護されたセキュアなサンドボックスを備えています。システムは近接戦略最適化(PPO)アルゴリズムを使用して150ステップにわたる深層学習を行い、最終的に250のタスクのベンチマークテストで全体的な通過率が98.8%に急上昇し、生成されたコアの96.8%が従来のtorch.compileを上回る実行速度を達成しました。
実際の応用とオープンソース計画に関しては、このシステムの完全なモデルウェイトはまだ公開されていませんが、研究チームは一般向けに6,000個のサンプルを含むCUDA-Agent-Ops-6Kデータセット、関連するSKILL.mdの仕様説明書および報酬とウォームアップトレーニングのレシピを公開しています。この成果は、今後AIインフラストラクチャ、大規模モデルの推論サービス、自動運転、および遅延に敏感な業界である量的取引などに広く応用されることが期待されています。
VIP会員