DeepSeek V4.1 Flash 釋出後,DeepSeek 網頁版和 App 也更新了,之前需要選擇的「快速」、「專家」和「識圖」都合併升級為一個入口論文。
全新的 DeepSeek V4.1 Flash 同時具備了日常對話、圖片理解與複雜問題解決能力,看起來像是把過去這一個多月,DeepSeek 釋出的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版幾個模型,全部融合在一起了論文。
在社交媒體上,大家對 V4.1 Flash 最多的評價就是「快」論文。
有網友展示自己在 DeepSeek Harness 內的對話,模型的執行速度是 217 tok/s 左右論文。而其他的測試結果顯示,V4.1 Flash 的執行速度為 420-507 tok/s ,比 Gemini 3.8 Flash 還要更快。
本來是融合了好幾個模型,主幹引數也接近上一代 Flash 的兩倍,從 284B 到了 552B,但怎麼速度就變快了論文。
雖然 4.1 看著是一次小更新,但從 DeepSeek 公開的技術報告來看,V4.1 Flash 採用了重新設計的模型架構,並擴大了訓練資料和強化學習規模論文。
展開全文
引數的增加,但處理長輸入和儲存上下文所需的開銷卻降低了,因為每 Token 的全域性 KV cache 只有 890 位元組,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,縮小了約 437 倍論文。
總引數變多,但是用來每一次工具呼叫、每一輪對話,模型上下文的 KV cache 卻減少了,而減少的 KV cache 也沒有因此讓 V4.1 Flash 變弱,在多個 Agent 基準測試上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol論文。
我們分析了 V4 Flash 和 V4.1 Flash 的兩篇論文技術報告,看到了 DeepSeek 在 Agent 時代到底要做什麼樣的高效率模型論文。
圖|論文地址:
模型變大論文,成本怎麼降下來
所謂的 KV cache 可以理解為模型處理過內容後留下的中間狀態;後續生成需要參考前文時,複用這些狀態,可以省下重新計算的開銷論文。
而當我們的上下文越長時,這個用來儲存模型狀態的工作臺檯面就會越大,佔的視訊記憶體越多論文。
DeepSeek 四代模型的演化,可以說就是在不斷地對 KV cache 進行壓縮,從 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 位元組,連 1 KB 都不到論文。
V4.1-Flash 採用的做法是一組組合拳論文。在架構上,40 層網路被修改成「編碼器 + 解碼器」兩半(CED 架構),Causal Encoder-Decoder,簡稱 CED。
它把 40 層網路分成前後兩部分:前 20 層是因果編碼器,後 20 層是解碼器論文。後半部分需要的全域性 KV 快取,可以直接由前半部分的最終輸出生成,因此,大部分輸入內容無需再完整經過後 20 層。
即解碼器需要的全域性記憶直接由編碼器的輸出投影生成,預處理長文字的計算量近乎減半論文。這對頻繁呼叫工具、快取經常不命中的 Agent 負載尤其省錢。
圖|DeepSeek 各代模型在不同上下文長度下的單 Token 解碼(Decode)FLOPs 對比論文。
具體來說,假設我們讓 AI 幫忙選一批辦公電腦,看產品資料、查價格、列出配置,最後給採購建議論文。
第一輪,它讀了幾款電腦的介紹論文。第二輪,我們補充預算,讓它重新篩選。第三輪,我們又接著說,有兩個崗位需要剪影片,配置得單獨調整。
就這樣每次我們只補充一句話,模型處理的內容卻可能越來越長論文。要接著完成任務,它需要記得前面選過哪些型號、為什麼淘汰某一款、預算是多少,以及哪些要求剛剛發生了變化。
V4 是標準的 decoder-only,整個模型「讀」和「寫」用同一套全部工序論文。給它一段 100 萬 token 的輸入,每個 token 都要完整穿過全部 43 層。
現在 V4.1 Flash 大部分只需經過前半段,後半程的解碼器不用再把原文逐層過一遍,而是直接拿編碼器讀完之後「消化好的筆記」,技術上是把編碼器最後一層的隱狀態投影成解碼器的全域性 KV cache,然後基於這份筆記開始生成論文。
圖|V4 Flash 和 V4.1 Flash 架構區別
這樣一來,模型處理輸入時,每個 token 啟用約 80 億引數;生成時,啟用約 160 億引數論文。對於足夠長的輸入,技術報告給出的預處理計算量接近減半。
可以說 V4.1 Flash 的 CED 這套結構就是衝著 Agent 負載設計,它優先節省的,正是 Agent 不斷接收材料時的計算論文。資料越長,省去大部分輸入在後半網路中的處理,就越有價值。
其次,注意力機制升級為 CSA2,讓不同層之間可以「借用」彼此算好的索引和快取,而不是各算各的;主 KV cache 更是用上了 FP4 量化,並且特意選了 OCP 開放標準格式,理由是「支援儘可能多的硬體平臺」論文。
V4.1-Flash 的 Compressed Sparse Attention 2,簡稱 CSA2,是讓多個網路層共享全域性 KV 快取論文。有的層負責建立快取、挑出相關位置;後續層可以沿用這份快取,重新選擇自己需要的位置;還有一些層連選擇結果也直接複用。
上一代部署方案會把全域性和部分區域性 KV 狀態長期儲存,以便使用者重新生成答案,或繼續多輪對話論文。但區域性狀態往往只在活躍會話的短時間內有用,長期保留會佔用大量儲存。
V4.1-Flash 把編碼器的區域性狀態放進只保留幾分鐘的記憶體池論文。狀態過期後,如果使用者又繼續任務,就重新計算最近 128 個 token,近似恢復需要的區域性狀態。DeepSeek 將這個辦法稱為 SWA Bounded Replay。
它用少量重算,換掉了長期儲存這部分狀態的開銷論文。移走區域性狀態,再疊加全域性快取壓縮,同等負載下,持久 KV 快取佔用降到上一代的約八分之一,且可以保證駐留 72 小時以上。
換句話說,使用者三天內回來繼續對話,服務商都不用重新付錢算一遍論文。
這種近似恢復的方案也會帶來取捨,恢復結果與完整重新計算並不完全相同,DeepSeek 在報告中稱已測場景中的質量影響很小,並把極端長上下文檢索、會話恢復時的狀態變化列為後續重點測試物件論文。
此外,V4.1 Flash 對比 V4 Flash 的不同,還在於 552B 主幹之外,模型還外掛了 196B 的「條件記憶」模組 Engram:它不做計算,只做查表論文。
透過把常見詞的 2 到 4 個組合預先存成一張巨大的雜湊表,用到時直接查出來接進網路,DeepSeek V4.1 Flash 的成本又能進一步下降論文。
省下計算和儲存之後論文,模型還得把題做對
V4.1-Flash 使用了包含影像和文字的 45 萬億 token 預訓練語料論文。它從語言模型預訓練開始就接觸多模態資料,影像經過視覺編碼器處理後,與文字一起進入語言主幹。
這讓 Agent 可以直接利用截圖檢查工作論文。例如,在生成網頁或辦公檔案後,讀取渲染出來的畫面,判斷排版、圖表或頁面是否需要修改。工具返回的文字結果之外,模型多了一種檢查依據。
後訓練部分,DeepSeek 也寫得相當明確:這次沿用了監督微調、強化學習和蒸餾,沒有引入新的後訓練演算法論文。團隊主要投入在訓練資料和環境的生產上。
這似乎也在說,RL 的軍備競賽,主戰場可能不在論文裡的新演算法,而在資料工程的水電煤論文。
他們把一道 Agent 任務拆成三個部分:問題、執行環境、驗證系統論文。模型要面對足夠難的要求,環境得能執行,驗收也要與題目對應。
通用 Agent 的材料,來自內部員工和外部合作伙伴反饋的工作記錄、工具介面與失敗案例論文。團隊據此重建工具的輸入輸出格式和行為約束,讓模型可以在模擬環境中反覆練習實際工作裡出過錯的步驟。
圖|DeepSeek 會不斷讀取圖片來檢查結果
以程式設計任務為例,有的 AI 負責出題、準備工作環境,有的負責試做,還有獨立的 AI 檢查題目和驗收要求是否一致、答案有沒有洩漏、能不能靠鑽漏洞過關論文。檢查不過,就修好題目再試。
任務用於新一輪強化學習後,解題軌跡又會成為重新稽覈題目質量的材料論文。某個測試如果一直誘導模型鑽空子,或者失敗源於環境配置而非能力,這些問題就需要回到任務生產環節處理。
圖|在 DeepSeek Harness 的 Minimal 模式下,隨著強化學習(RL)訓練規模的擴大,模型在各項程式碼智慧體基準測試中的效能均有所提升論文。
在 DeepSeek 的歸納中,這次後訓練的收益主要來自任務規模、多樣性和可驗證性的改善論文。模型做過更多型別的工作,也更頻繁地得到與結果相關的反饋。
工具軟體本身也會影響表現,DeepSeek 用不同工具框架測試同一個模型,發現系統提示、工具配置和歷史資訊管理的差異,都可能改變任務結果論文。
DeepSeek 在報告中表示,後續會繼續擴大模型、資料和強化學習規模,並把模型與工具框架放在一起最佳化論文。
V4.1-Flash 目前是這一新架構系列中最小尺寸的模型,未來的 V4.1-Pro 或許會延續這一架構,但從上次 V4 Pro 正式版的經歷來看,DeepSeek 顯然不會再輕易就釋出一款新的 Pro 模型論文。
Agent 測試進步明顯論文,難題仍有差距
能力提升最集中地出現在 Agent 測試中論文。
在 DeepSeek 公佈的最高推理檔位結果裡,V4.1-Flash 的 DeepSWE v1.1 軟體問題解決率達到 74.2%,上一代 Flash 為 54.4%,V4-Pro 為 62.7%論文。同一測試表格中的 Opus-5 為 74.0%,GPT-5.6 Sol 為 73.0%。
Terminal-Bench 2.1 的成績從 82.7 升到 90.6;面向工作自動化的 AutomationBench,則從 37.7 升到 54.8,也高於同表中的 V4-Pro、Opus-5 和 GPT-5.6 Sol論文。
最難的任務仍然拉得開距離論文。Terminal-Bench 4.0 上,新 Flash 從上一代的 7.0 提高到 31.2,但 Opus-5 為 51.8。在高難科學問答 GPQA Diamond 上,V4.1-Flash 的 90.9 也低於 V4-Pro 的 92.4。
原生視覺帶來了新的可用範圍,領先模型的優勢也還在論文。帶工具的專業圖表測試 Chartography 中,V4.1-Flash 得到 78.9,高於 Kimi K3 的 68.1,低於 Opus-5 的 84.0。
模型的表現,還會受 Agent 框架影響論文。同一個 V4.1-Flash,在最高推理檔位下,用 mini-SWE 跑 DeepSWE 得到 74.2,換成 Claude Code 為 69.8,Codex 為 65.6。系統提示、工具定義和上下文管理,都會影響模型能否把能力用出來。
另一方面,更長的思考也會增加賬單論文。
DeepSeek 在強化學習中加入了隨推理檔位變化的長度懲罰,讓同一模型學會用不同長度的推理處理任務論文。API 提供 low、high、max 三檔,分別對應內部 50、75、100 的 effort 值。
圖|報告中的總體趨勢是,增加推理投入能改善成績,但圖表也出現了更高檔位得分下降的情況論文。
在 V4 Flash 報告的結尾,DeepSeek 列了 7 條未來方向,包括架構精簡、訓練穩定性、稀疏嵌入、低延遲、長程 Agent、多模態,和資料合成,5 個月後 V4.1 似乎正逐條解決這些問題論文。
模型可以更大,思考可以更長,工具也可以呼叫更多次論文。只要最終把任務做完所需要的視訊記憶體、延遲和總成本繼續下降,它就依然是一款更便宜的模型。
從 7 月底釋出 V4 Flash,到 8 月推出 V4 Pro,很快又更新了視覺推理預覽模型 Vision Exp,再到這兩天更新 V4.1 Flash,DeepSeek 的整體釋出節奏對比過去一年,似乎是前所未有的快論文。