一、 沉寂半年後重回大衆視野
在人工智能領域備受關注的小米迎來新動態。沉寂半年的小米 MiMo 大模型團隊負責人、前 DeepSeek 研究員羅福莉,於9月17日凌晨在 X 平臺發文,正式對外公開並直播了當前大模型的訓練過程。此次動作標誌着她再次捲入激烈的大模型技術競爭中,同時也讓外界得以首次窺探小米最新一代模型的內部訓練狀態。
二、 MiMo-V2.6的 RL 實驗與三大擴展方向
根據羅福莉分享的實時訓練頁面顯示,目前小米旗下的最新大模型MiMo-V2.6正在進行大規模的 Agent(智能體)強化學習(RL)實驗。團隊在此次運行中重點推進了三個維度的技術擴展:
計算資源擴展:每步計算資源大約消耗20億 token,包含1568個提示乘以16次 rollout,採取完全異步的運行模式。
環境和測試框架擴展:構建了多任務代理式 RL,在單次運行中同步混合多個測試框架。
評估計算擴展:引入代理式組內信用分配,配備了實際測試用例和基於量規的獎勵機制。
羅福莉同時透露,團隊將在未來的幾周內逐步向外界開源相關的技術細節。
三、 高昂的訓練成本與雙版本表現
從公開的實時訓練數據來看,此次大模型訓練展現出極高的資金與算力消耗。訓練頁面中目前主要包含兩個並行版本:
MiMo-V2.6-Pro:累計訓練時長達到1天19小時,累計耗資約89萬美元,平均每小時的訓練成本超過2萬美元。
MiMo-V2.6-Flash:累計訓練時長爲1天14小時,累計耗資約39.7萬美元,平均每小時的訓練成本超過1萬美元。
兩個版本的累計訓練成本目前已經突破128萬美元,折算下來整體每小時的耗費超過3萬美元,充分凸顯出當前頭部大模型在強化學習階段對海量算力的極致訴求。
四、 團隊背景與此前進展
在業務佈局方面,小米高層此前曾多次公開披露 AI 領域的階段性成果。今年3月份,小米創始人雷軍曾在微博發文透露,萬億參數大模型MiMo-V2-Pro曾躋身全球大模型綜合智能排行榜 Artificial Analysis 的全球第八位,在品牌排名中位列全球第五,整體表現超越了 xAI 的 Grok 模型,並計劃在後續保持快速迭代與增強。
作爲核心領軍人物,羅福莉是一位備受矚目的“95後”AI青年科學家。公開資料表明,她本科畢業於北京師範大學計算機專業,隨後在北京大學攻讀計算語言學碩士學位。畢業後,她曾加入阿里巴巴達摩院機器智能實驗室擔任研究員,負責多語言預訓練模型 VECO 的開發,並推動了 AliceMind 項目的開源。
2022年,羅福莉加入 DeepSeek 母公司幻方量化從事深度學習相關工作,此後擔任 DeepSeek 深度學習研究員,參與了 DeepSeek-V2等核心模型的研發工作。直到去年11月12日,羅福莉在朋友圈發文確認加入小米,投身 Xiaomi MiMo 團隊,並致力於構建從語言邁向物理世界的 AGI(通用人工智能)未來。
VIP會員