CLUE 團隊最新發佈的 SuperCLUE-Terminal 中文智能體終端編程測評榜單顯示,DeepSeek-V4-Pro-0813 拿下 51.52 分,在所有參測模型中位列第二,僅落後於登頂的 Kimi K3。更值得注意的是,它在取得這一成績的同時保持着極低的調用成本,性價比優勢在一衆高分模型中格外突出。該榜單專門面向國內開發者設計,全部採用本土真實編程任務,並統一以 Claude Code 作爲運行框架,公平對比各大模型理解中文需求、規劃任務、調用工具及排錯改代碼的完整能力。

image.png

評測的真實感來自其任務設定:每道考題需要模型完成 50 至 110 輪交互,單題完整運行耗時半小時到一小時半,能高度還原日常開發中的複雜工作流。本輪榜單中 Kimi K3 以 60.61 分排名第一,DeepSeek-V4-Pro-0813 緊隨其後,分數高於 GLM-5.2 的 48.48 分和老版 DeepSeek-V4-Flash 的 46.46 分,穩居第一梯隊。

1.42 元單題成本,硬剛頂級算力

最亮眼的是 DeepSeek-V4-Pro-0813 的成本控制:單題調用成本僅約 1.42 元,大約是 Kimi K3 的十四分之一、GLM-5.2 的十六分之一。在頭部模型比拼分數往往只差幾分的當下,這種數量級的成本差距,意味着中小團隊用得起"接近頂級"的代碼能力,而不必爲每一次交互支付高昂算力費。

從實測場景看,該模型覆蓋了前端頁面、3D 遊戲和工程腳本修改等真實需求,能完整閉環遊戲開發邏輯,碰撞、計分、結算功能均運轉正常,頁面配色與交互反饋也擺脫了模板化的 AI 風格。少數創意繪圖類題目會出現結構小瑕疵,但整體完成度仍處於領先水平。對預算敏感的中小企業和獨立開發者而言,DeepSeek-V4-Pro-0813 用"第二名的分數、十四分之一的價格"重新定義了編程模型的性價比基準——當頂級能力不再意味着頂級開銷,AI 編程的普及門檻正在被真正拉低。