深度求索今日正式發佈了全新模型結構系列中的最小尺寸成員——DeepSeek V4.1Flash。作爲一款具備原生多模態視覺理解能力的輕量化模型,其設計初衷旨在實現更高的能力上限、更快的推理速度、更大的吞吐量,並具備向更大參數模型擴展的潛力。
在覈心架構方面,DeepSeek V4.1Flash 採用了552B 參數的 MoE(混合專家)架構,並創新性地引入了全新的 Causal-Encoder-Decoder 結構。由於採用了輸入和輸出不對稱的設計,其輸入激活僅有8B,輸出激活爲16B,使得整體成本顯著低於同尺寸的已知模型。配合全新的預訓練方式以及更大規模的強化學習後訓練,該模型在各項基準測試中的智能水平成功超越了包括 DeepSeek V4Pro 在內的一衆旗艦模型。

在效率優化與成本控制上,新一代模型大幅壓縮了 KV Cache 緩存的大小。相比上一代模型,V4.1Flash 對高帶寬內存(HBM)的需求減少至1/4,對固態硬盤(SSD)的需求減少至1/8。尤其在 Agent 使用場景中,由於上下文存儲和緩存命中的費用佔比較高,這一壓縮大幅降低了相關任務的實際使用成本。據統計,相對於初代模型,其 KV Cache 已經縮減至原來的1/437。
隨着新模型的正式上線,DeepSeek 對相關產品線和計費策略進行了系統性調整。DeepSeek V4.1Flash 已同步上線 DeepSeek API,用戶只需將模型名稱更改爲 deepseek-flash 即可調用。舊版本的 V4Flash 與 V4Flash Vision Exp 已正式下線,而舊模型名(deepseek-v4-flash 和 deepseek-v4-flash-vision-exp)目前被暫時路由到 V4.1Flash。鑑於 V4.1Flash 在性能、費用、速度和總用時上已全面超越 V4Pro,官方計劃有序下線 V4Pro 模型:在2026年9月14日12:00之後至 V4.1Pro 上線之前,所有訪問 deepseek-v4-pro 的請求將全部被路由至 V4.1Flash 並按其單價計費。目前,騰訊旗下的 WorkBuddy、CodeBuddy 以及 OpenCode 等官方合作伙伴已全量接入該模型。
得益於底層架構的創新,DeepSeek V4.1Flash 能夠以更低的成本服務海量用戶,官方也順勢下調了該模型的 API 定價。同時,爲了更合理地調配計算資源,新定價延續了峯谷定價機制,閒時價格爲高峯時段的一半,以鼓勵用戶靈活調整任務執行時間,新價格已於2026年9月10日12:00正式生效。
VIP會員