大規模モデルの強化学習は、より大きなGPUクラスターとより多くのトレーニングデータに向かって進んでおり、トレーニング効率はもはや脇役ではなく、重要な課題となっています。テンセント・ハンドゥンチームの最新研究は、長期間無視されてきた古い問題に注目しています。つまり、モデルが自身でトレーニングデータを生成し、ロールアウト生成とトレーニングそのものが異なるスケールで進行する場合、バッチサイズという技術をどのように再構築するのかという点です。

この研究は、古典的な臨界バッチサイズ理論から出発し、それをオンライン大規模言語モデルでの強化学習という新しいシナリオに再推論しました。結果は現実的です。GRPOおよびPPOという2つの主流アルゴリズムにおいて、バッチサイズを拡大する範囲内で学習率を調整するだけで、「各応答」が学ぶべき内容が薄められることを防ぐことができます。つまり、バッチサイズが大きいほど良いわけでも、変化しないものでもなく、調整可能な適切な範囲が存在するということです。

実際のハードウェアのコスト面では、効果は明らかです。固定されたハードウェア構成でバッチサイズを大きくすると、PPOの生成フェーズにおけるスループットは最大で2.29倍に向上します。また、測定された最適なGRPO設定では、以前よりも29%少ない時間で同じ検証目標に到達できました。日々GPUを消費し続けるトレーニングチームにとって、これは同じクラスターと目標を持つ場合、より早く結果を出すか、単位時間あたりにより多くの処理を行うことができるということです。強化学習の中で最も高価な生成コストが、静かに削減されています。

この研究の意義は、オンラインRLのスケーラビリティに実用的な調整スイッチを提供した点にあります。モデルは強化学習において生徒であるだけでなく、問題を作成する側でもあり、生成とトレーニングの2つのフローのスケーリングの不一致が効率のブラックホールの原因となっています。一方で、臨界バッチサイズと学習率の再調整の組み合わせは、この隙間を埋めることができます。業界が誰がモデルを大きくするかを競っている中、テンセント・ハンドゥンは既存のGPUをどう使いこなすかに注力しています。