DeepSeek-V4.1-Flash近日上線千問AI平臺,API服務與Token Plan同步開放。開發者可通過標準API接入業務系統,也能在Qoder、千問APP、Codex等工具中直接調用Token Plan,用於代碼、文檔、視覺理解與智能體任務。

QQ20260914-144307.jpg

據平臺公告,該模型爲DeepSeek新一代輕量旗艦,總參數552B的MoE架構,採用Causal-Encoder-Decoder非對稱結構,輸入激活約8B、輸出激活約16B;原生支持文本與圖像理解,最長上下文100萬token,平臺最大輸出約393K。官方稱其在多項Agent與代碼基準上較同系前代提升,並以更低激活參數換取高吞吐、低延遲。

成本側是本次上架重點。新一代緩存壓縮使KV Cache對HBM需求降至上一代1/4、對SSD存儲需求降至1/8,長上下文與多輪工具調用更省資源。千問頁面給出分時價:閒時輸入1元/百萬token、輸出4元/百萬token;忙時輸入2元、輸出8元。速率限制RPM15K、TPM1M,功能覆蓋前綴補全、函數調用、緩存、結構化輸出、批量任務與聯網搜索。

部署方面,阿里雲百鍊聯合vLLM開源社區完成適配,中國站、國際站均可調用,覆蓋北京、新加坡及Global美國、德國、日本、香港等地域。百鍊文檔顯示,該模型支持多輪對話、函數調用、聯網搜索、上下文緩存與結構化輸出,max_tokens上限約393216,適合企業把長文檔解析、客服知識庫、代碼倉庫問答和多模態審單等工作遷移到同一接口。

業內認爲,V4.1-Flash把“大參數、小激活、強緩存”的組合放到千問生態,會降低長上下文Agent的試錯成本;對中小團隊而言,閒時低價加Token Plan訂閱,可更靈活地做批量推理與原型驗證。