階躍今天全量開放新一代旗艦基座 Step5Preview,定位很明確——一款爲真實世界裏 Agentic 任務而生的主力模型。它想解決的是 AI 模型裏那道經典的"帕累託題":能力、效率、成本三個目標互相拉扯,歷史上想在一個維度上往前走,往往得拿另一個維度去換;而推進帕累託前沿,不是讓取捨消失,而是用新設計把整條邊界往外推。

這次的推法是稀疏 MoE 架構。Step5Preview 總參數600B,但每次只激活27B,原生支持100萬 Token 上下文窗口,並且能直接吃文本和視覺兩種輸入。在 Artificial Analysis 的 Intelligence Index 裏,它拿到44分,擠進全球開源模型前三;更狠的是單任務成本只有 Claude Opus5的八分之一——同一筆預算換更強智能,或者同等能力以更低價格落地,兩條路它都給鋪了。

image.png

硬實力在幾個高難度基準上露了臉。在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投資研究評測 FrontierFinance,以及跨領域深度研究評測 DRACO 上,Step5Preview 僅次於 GPT-6Astra 或 Claude Opus5,把其他參評的開源模型甩在身後;GDPval-AA v2也採用了截至9月19日的最新結果,DeepSWE v1.1在 SWE-agent harness 下以 temperature=1.0、top_p=0.95評測。

編程這塊,階躍自建了 StepCodeBench,覆蓋553個獨立代碼倉庫、9類任務、20個應用領域和33種編程語言。Step5Preview 在整體成功率和跨場景穩定性上都站得住,Bug 修復、功能開發、重構、環境配置這類真實活兒都能接。一個演示裏,它讀着 ESP32設備的大量開發文檔,把一塊 ESP32-S3開發板改造成支持藍牙按鍵和語音輸入的 Vibe Coding 鍵盤,過程中自己開 COM 串口、調攝像頭、截設備圖、模擬鼠標,再根據真實報錯連續改代碼跑調試,一口氣幹了三個多小時。

image.png

長週期任務更見真章。第一項實驗給24小時、一張 H100,讓它從零優化一個 MLA GPU 內核(頭維度512、batch1、64個注意力頭、8192token)。Step5Preview 自主改代碼、跑內核、測吞吐,遇到跑得通卻降速的方案就放棄、從最佳版本接着爬,約22小時後把峯值性能頂到508TFLOPS,壓過了 Claude Opus5的493TFLOPS。第二項實驗同樣24小時,讓它通過自動化後訓練提升一個 Qwen3-30B-A3B 基礎模型在 AIME24上的表現,模型自己決定怎麼用標註 API、怎麼調數據,最終把準確率從53.3% 拉到60%,和 Opus5持平卻更省標註 token。

前端與視覺上,它不只會寫網頁,還能調用 Blender 建並反覆改3D 資產,再接進 Three.js 做交互應用和遊戲;甚至從一本1922年的《廣九鐵路旅行指南》裏抽信息,做出行程查詢、費用計算和路線回放,讓小火車沿百年前的線路跑起來,把史料變成可交互產品。

金融被當成綜合能力的試金石。階躍圍繞公司研究這一高難度流程建了三項內部評測:FinStepBench-LiveSearch 考隨需求變化檢索覈驗金融信息,CorporateValuation 考把數據和假設轉成可復現估值,DeepResearch 考從證據收集到完整研究報告的全程;外部基準 FrontierFinance 則用220道專家題、11543項評分標準覆蓋六類投資場景。四項裏 Step5Preview 都交出強結果。

從 Step3.5Flash、Step3.7Flash 到 Step5Preview,階躍押的始終是同一件事:下一階段的 Scaling 不只是堆更多 Compute,更是把 Compute 用得更高效。今天全量開放之後,完整模型權重將在10月15日釋放,這款把"能力—成本—效率"重新撮合過一遍的開源旗艦,正等着開發者把它當成 Agent 任務的日常主力。