9月17日凌晨,小米MiMo大模型團隊負責人、前DeepSeek研究員羅福莉在X平臺發文,首次公開旗下最新大模型MiMo-V2.6的強化學習(RL)訓練進展,並同步上線實時訓練頁面,開啓大模型RL階段的全程公開直播。此舉標誌着小米在物理世界與通用智能(AGI)道路上的探索邁入全新突破期,相關技術細節亦計劃於未來數週內逐步開源。
技術架構上,MiMo-V2.6正在開展大規模多任務智能體(Agent)RL實驗。團隊圍繞三大維度進行全面擴展:算力層面實現單步約20億Token(1568個Prompt×16次rollout)的完全異步並行;環境層面搭建支持單次運行混合多框架的代理式RL;評估層面則採用帶測試用例與量規獎勵的組內信用分配機制。
直播頁面實時呈現訓練進度、Token消耗與成本指標,其中MiMo-V2.6-Pro版本訓練約1天19小時、耗資89萬美元,MiMo-V2.6-Flash時長1天14小時、耗資39.7萬美元,雙版本累計訓練成本已突破128萬美元。
作爲雷軍此前從DeepSeek重磅引進的“95後”AI科學家,羅福莉曾主導達摩院多語言預訓練及DeepSeek-V2研發,於去年11月正式加盟小米並執掌MiMo大模型團隊。今年3月,上一代萬億參數模型Mimo-V2-Pro已登頂Artificial Analysis全球大模型綜合智能榜第八位(品牌榜第五)。
本次MiMo-V2.6通過透明化直播與工程細節開源,展示了小米在RL Scaling Law(強化學習擴展定律)上的深度積累,也將推動前沿大模型訓練從“黑盒試錯”向“極客級過程開源”的範式演進。
VIP會員