模型能夠完成本地部署,並不意味着它在真實業務場景中能夠遊刃有餘。在具體的業務流程中,AI不僅需要具備基礎的對話能力,還必須精準理解複雜的規則、遵守安全邊界,並正確調用外部工具以輸出符合規範的結果。爲了攻克這一痛點,螞蟻ASystem團隊聯合開源社區共同維護的本地化大模型後訓練工具包AReno,近日攜手百靈大模型推出了一條輕量級的後訓練實踐路徑,成功在單機環境中打通了Agentic RL(強化學習)閉環。

爲了確保整個技術方案具備高度的可復現性,本次合作選取了規則清晰、反饋直接的井字棋作爲最小驗證任務。實驗基於DGX Spark硬件環境,對擁有7.9B總參數但激活參數僅爲1.3B的Ling-3.0-tiny模型展開了後訓練。在訓練初期,模型雖然能夠理解基本規則,但在交互過程中仍會出現非法動作;而通過將任務規則轉化爲精確的Reward反饋機制,並藉助GSPO算法進行400個步驟的訓練後,模型的獎勵均值明顯提升,輸出長度也隨之收斂。複測結果充分證明,模型在工具調用與動作選擇上的穩定性與合理性得到了質的飛躍。

image.png

這一探索的核心價值在於驗證了一條透明、可復現的任務適配方法論:從精準發現錯誤、定義可驗證反饋,到完成本地訓練並回到同一環境進行復測。該模式不僅適用於棋類實驗,更可以流暢遷移至工具調用修復、結構化字段抽取、領域指令遵循以及業務流程智能體等多元化的真實生產場景中。

目前,Ling-3.0-tiny已提供BF16、FP8和INT4等多種開源版本,開發者可通過Hugging Face或魔搭社區獲取並使用,同時也可以訪問AReno開源倉庫參與後續的代碼共建與技術討論。