智譜今日正式發佈 GLM-5.3,與前代最大的不同在於——基座模型完全沒變,提升全部來自後訓練階段的 Scaling。通過數十倍規模的長程任務環境、更豐富的環境類型以及超長的後訓練時間,智譜在相同基座上把模型的智能上界顯著擡高。公司內部評測顯示,新模型的編程體感較 GLM-5.2 提升約 50%,一躍成爲當前編程能力最強的開源模型。

在公開基準上,GLM-5.3 也交出了亮眼答卷。Terminal-Bench 3.0 得分從 4.6 躍升至 28.3,DeepSWE v1.1 從 46.2 升至 66.9,Agents' Last Exam 從 23.8 提到 28.5,GDPval-AA v2 達到 1769 分。其在編程與智能體能力上已接近 Claude Fable 5,體感超過其他國產模型,在 Terminal Bench 3.0 與 Agents' Last Exam(CLI)兩項測試中拿下開源第一

image.png

後訓練 Scaling:基座潛力遠未觸頂

智譜強調,上述全部提升均來自後訓練而非換模型。基於 IndexShare、SAO 以及持續演進的新一代 Slime 框架,團隊在與 GLM-5.2 完全相同的基座上高效推進強化學習,並坦言"可能遠未開發出這個基座的智能上界"。這一思路釋放出明確信號:大模型競爭未必總要靠堆參數,把已有底座"練透"同樣能逼近前沿水平。

image.png

在安全維度,GLM-5.3 在白盒代碼審查與漏洞發現等任務中表現持平 Mythos 5,展現出面向網絡防禦場景的潛力。智譜將在發佈兩週後開放完整模型權重,但前提是完成安全評估與模型加固,以限制潛在攻擊能力、保留防禦價值。與此同時,新模型即日上線官方編程工具 ZCode、AutoClaw 及 GLM Coding Plan,並面向 Trae、釦子、WorkBuddy / CodeBuddy、Qoder 等編碼平臺開放搶先體驗。當開源模型在編程賽道逼近閉源旗艦,國產大模型的下半場較量,正從"誰更會說話"轉向"誰更會幹活"。