1. 半年間の沈黙を経て再び注目を集める
人工知能分野で注目を集めている小米が新たな動きを見せた。半年間沈黙していた小米 MiMo 大規模モデルチームの責任者で、かつて DeepSeek の研究員だった Luo Fuli は、9月17日午前、X プラットフォームで投稿し、現在の大規模モデルのトレーニング過程を正式に公開し、ライブ配信した。この行動は彼女が再び大規模モデル技術競争に巻き込まれることを示し、また外界が小米の最新モデルの内部トレーニング状況を初めて覗く機会となった。
2. MiMo-V2.6のRL実験と3つの拡張方向
ロフリが共有したリアルタイムのトレーニング画面によると、現在小米の最新の大規模モデルである MiMo-V2.6は、大量のエージェント(スマートエージェント)強化学習(RL)実験を行っている。今回の運用では、3つの次元における技術拡張を重点的に進めている:
計算リソースの拡張:1ステップあたりの計算リソースは約20億トークンを消費しており、1568個のプロンプトに16回のロールアウトを含み、完全非同期の動作モードを採用している。
環境およびテストフレームワークの拡張:複数タスク型エージェントによる RL を構築し、一度の実行で複数のテストフレームワークを同時に混合して実行している。
評価計算の拡張:エージェント内の信用割り当てを導入し、実際のテストケースとメーターに基づいた報酬メカニズムを備えている。
ロフリはまた、今後数週間で関連する技術詳細を段階的にオープンソース化していく予定であることを明らかにした。
3. 高額なトレーニングコストと2つのバージョンの性能
公開されたリアルタイムのトレーニングデータを見ると、今回の大きなモデルのトレーニングは非常に高い資金と計算能力を要している。トレーニング画面には現在主に2つの並行バージョンが含まれている:
MiMo-V2.6-Pro:累計トレーニング時間は1日19時間で、累計費用は約89万ドル、毎時間のトレーニングコストは2万ドル以上。
MiMo-V2.6-Flash:累計トレーニング時間は1日14時間で、累計費用は約39.7万ドル、毎時間のトレーニングコストは1万ドル以上。
2つのバージョンの累計トレーニングコストはすでに128万ドルを超え、1時間あたりの総合コストは3万ドルを超えることから、現在のトップレベルの大規模モデルが強化学習段階において膨大な計算能力を必要としていることが明確に示されている。
4. チームの背景とこれまでの進展
ビジネスの展開に関して、小米の高層管理職は以前からAI分野の段階的な成果を頻繁に公表してきた。今年3月、小米の創業者レイ・ジンは微博で投稿し、1兆パラメータを持つ大規模モデル MiMo-V2-Pro が Artificial Analysis の世界大規模モデルの総合知能ランキングで世界第8位となり、ブランドランキングでは世界第5位となり、全体的な表現は xAI の Grok モデルを上回ったことを明らかにした。その後も迅速な反復と強化を続ける予定である。
中心的な指導者として、ロフリは注目を集める「95後」のAI若手科学者である。公開資料によると、彼女は北京師範大学でコンピュータ専攻の学士号を取得し、その後北京大学で計算言語学の修士号を取得した。卒業後はアリババの達摩院機械知能研究所に研究員として参加し、多言語事前学習モデル VECO の開発に携わり、AliceMind プロジェクトのオープンソース化を推進した。
VIP会員