深度求索 發佈 DeepSeek V4.1 Flash 模型。這是其全新模型結構系列中尺寸最小的模型,具備原生多模態視覺理解能力。新模型結構的設計初衷是:能力上限更高、推理速度更快、吞吐更大、可擴展到更大參數模型。
輸入激活僅 8B,HBM 需求降至 1/4
DeepSeek V4.1 Flash 爲 552B 參數的 MoE 模型,採用全新的 Causal-Encoder-Decoder 結構,輸入和輸出不對稱——輸入激活只有 8B,輸出激活 16B,成本顯著低於已知的同尺寸模型。新模型還採用了新的預訓練方式,並經過更大規模的強化學習後訓練,在基準測試中成功超越了包括 DeepSeek V4 Pro 在內的一衆旗艦模型的智能水平。
此外,新一代模型大幅減少了 KV Cache 緩存大小,與上一代相比對 HBM 的需求減少到 1/4,對 SSD 的需求減少到 1/8;相對於初代模型,KV Cache 僅爲原來的 1/437。在 Agent 使用場景中緩存命中費用往往佔比較高,對 KV Cache 的壓縮大幅降低了 Agent 類任務的使用成本。

已同步上線 API,V4 Pro 將於 9 月 14 日路由切換
DeepSeek V4.1 Flash 已同步上線 DeepSeek API,原生支持多模態,將模型名稱更改爲 deepseek-flash 即可調用。舊版本模型 V4 Flash 與 V4 Flash Vision Exp 現已下線,出於兼容考慮,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 將被暫時路由到 V4.1 Flash。
經多方測試,V4.1 Flash 在性能、費用、速度、總用時等各項指標上已全面超越 V4 Pro,官方因此計劃有序下線 V4 Pro:北京時間 2026 年 9 月 14 日 12:00 之後,至未來 V4.1 Pro 上線之前,用戶訪問 deepseek-v4-pro 的請求將全部路由到 V4.1 Flash,並按 V4.1 Flash 單價計費。

騰訊(WorkBuddy、CodeBuddy)和 OpenCode 作爲官方合作伙伴,現已全量接入 DeepSeek V4.1 Flash。得益於架構創新,官方相應下調了 V4.1 Flash 的定價,同時仍採用峯谷定價——閒時價格爲高峯時段價格的一半,新價格於 2026 年 9 月 10 日 12:00 起生效。模型權重與技術報告已同步在 Hugging Face 開放。
VIP會員