扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

DeepSeek V4.1 Flash 釋出後,DeepSeek 網頁版和 App 也更新了,之前需要選擇的「快速」、「專家」和「識圖」都合併升級為一個入口論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

全新的 DeepSeek V4.1 Flash 同時具備了日常對話、圖片理解與複雜問題解決能力,看起來像是把過去這一個多月,DeepSeek 釋出的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版幾個模型,全部融合在一起了論文

在社交媒體上,大家對 V4.1 Flash 最多的評價就是「快」論文

有網友展示自己在 DeepSeek Harness 內的對話,模型的執行速度是 217 tok/s 左右論文。而其他的測試結果顯示,V4.1 Flash 的執行速度為 420-507 tok/s ,比 Gemini 3.8 Flash 還要更快。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

本來是融合了好幾個模型,主幹引數也接近上一代 Flash 的兩倍,從 284B 到了 552B,但怎麼速度就變快了論文

雖然 4.1 看著是一次小更新,但從 DeepSeek 公開的技術報告來看,V4.1 Flash 採用了重新設計的模型架構,並擴大了訓練資料和強化學習規模論文

展開全文

引數的增加,但處理長輸入和儲存上下文所需的開銷卻降低了,因為每 Token 的全域性 KV cache 只有 890 位元組,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,縮小了約 437 倍論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

總引數變多,但是用來每一次工具呼叫、每一輪對話,模型上下文的 KV cache 卻減少了,而減少的 KV cache 也沒有因此讓 V4.1 Flash 變弱,在多個 Agent 基準測試上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol論文

我們分析了 V4 Flash 和 V4.1 Flash 的兩篇論文技術報告,看到了 DeepSeek 在 Agent 時代到底要做什麼樣的高效率模型論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

圖|論文地址:

模型變大論文,成本怎麼降下來

所謂的 KV cache 可以理解為模型處理過內容後留下的中間狀態;後續生成需要參考前文時,複用這些狀態,可以省下重新計算的開銷論文

而當我們的上下文越長時,這個用來儲存模型狀態的工作臺檯面就會越大,佔的視訊記憶體越多論文

DeepSeek 四代模型的演化,可以說就是在不斷地對 KV cache 進行壓縮,從 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 位元組,連 1 KB 都不到論文

V4.1-Flash 採用的做法是一組組合拳論文。在架構上,40 層網路被修改成「編碼器 + 解碼器」兩半(CED 架構),Causal Encoder-Decoder,簡稱 CED。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

它把 40 層網路分成前後兩部分:前 20 層是因果編碼器,後 20 層是解碼器論文。後半部分需要的全域性 KV 快取,可以直接由前半部分的最終輸出生成,因此,大部分輸入內容無需再完整經過後 20 層。

即解碼器需要的全域性記憶直接由編碼器的輸出投影生成,預處理長文字的計算量近乎減半論文。這對頻繁呼叫工具、快取經常不命中的 Agent 負載尤其省錢。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

圖|DeepSeek 各代模型在不同上下文長度下的單 Token 解碼(Decode)FLOPs 對比論文

具體來說,假設我們讓 AI 幫忙選一批辦公電腦,看產品資料、查價格、列出配置,最後給採購建議論文

第一輪,它讀了幾款電腦的介紹論文。第二輪,我們補充預算,讓它重新篩選。第三輪,我們又接著說,有兩個崗位需要剪影片,配置得單獨調整。

就這樣每次我們只補充一句話,模型處理的內容卻可能越來越長論文。要接著完成任務,它需要記得前面選過哪些型號、為什麼淘汰某一款、預算是多少,以及哪些要求剛剛發生了變化。

V4 是標準的 decoder-only,整個模型「讀」和「寫」用同一套全部工序論文。給它一段 100 萬 token 的輸入,每個 token 都要完整穿過全部 43 層。

現在 V4.1 Flash 大部分只需經過前半段,後半程的解碼器不用再把原文逐層過一遍,而是直接拿編碼器讀完之後「消化好的筆記」,技術上是把編碼器最後一層的隱狀態投影成解碼器的全域性 KV cache,然後基於這份筆記開始生成論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

圖|V4 Flash 和 V4.1 Flash 架構區別

這樣一來,模型處理輸入時,每個 token 啟用約 80 億引數;生成時,啟用約 160 億引數論文。對於足夠長的輸入,技術報告給出的預處理計算量接近減半。

可以說 V4.1 Flash 的 CED 這套結構就是衝著 Agent 負載設計,它優先節省的,正是 Agent 不斷接收材料時的計算論文。資料越長,省去大部分輸入在後半網路中的處理,就越有價值。

其次,注意力機制升級為 CSA2,讓不同層之間可以「借用」彼此算好的索引和快取,而不是各算各的;主 KV cache 更是用上了 FP4 量化,並且特意選了 OCP 開放標準格式,理由是「支援儘可能多的硬體平臺」論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

V4.1-Flash 的 Compressed Sparse Attention 2,簡稱 CSA2,是讓多個網路層共享全域性 KV 快取論文。有的層負責建立快取、挑出相關位置;後續層可以沿用這份快取,重新選擇自己需要的位置;還有一些層連選擇結果也直接複用。

上一代部署方案會把全域性和部分區域性 KV 狀態長期儲存,以便使用者重新生成答案,或繼續多輪對話論文。但區域性狀態往往只在活躍會話的短時間內有用,長期保留會佔用大量儲存。

V4.1-Flash 把編碼器的區域性狀態放進只保留幾分鐘的記憶體池論文。狀態過期後,如果使用者又繼續任務,就重新計算最近 128 個 token,近似恢復需要的區域性狀態。DeepSeek 將這個辦法稱為 SWA Bounded Replay。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

它用少量重算,換掉了長期儲存這部分狀態的開銷論文。移走區域性狀態,再疊加全域性快取壓縮,同等負載下,持久 KV 快取佔用降到上一代的約八分之一,且可以保證駐留 72 小時以上。

換句話說,使用者三天內回來繼續對話,服務商都不用重新付錢算一遍論文

這種近似恢復的方案也會帶來取捨,恢復結果與完整重新計算並不完全相同,DeepSeek 在報告中稱已測場景中的質量影響很小,並把極端長上下文檢索、會話恢復時的狀態變化列為後續重點測試物件論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

此外,V4.1 Flash 對比 V4 Flash 的不同,還在於 552B 主幹之外,模型還外掛了 196B 的「條件記憶」模組 Engram:它不做計算,只做查表論文

透過把常見詞的 2 到 4 個組合預先存成一張巨大的雜湊表,用到時直接查出來接進網路,DeepSeek V4.1 Flash 的成本又能進一步下降論文

省下計算和儲存之後論文,模型還得把題做對

V4.1-Flash 使用了包含影像和文字的 45 萬億 token 預訓練語料論文。它從語言模型預訓練開始就接觸多模態資料,影像經過視覺編碼器處理後,與文字一起進入語言主幹。

這讓 Agent 可以直接利用截圖檢查工作論文。例如,在生成網頁或辦公檔案後,讀取渲染出來的畫面,判斷排版、圖表或頁面是否需要修改。工具返回的文字結果之外,模型多了一種檢查依據。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

後訓練部分,DeepSeek 也寫得相當明確:這次沿用了監督微調、強化學習和蒸餾,沒有引入新的後訓練演算法論文。團隊主要投入在訓練資料和環境的生產上。

這似乎也在說,RL 的軍備競賽,主戰場可能不在論文裡的新演算法,而在資料工程的水電煤論文

他們把一道 Agent 任務拆成三個部分:問題、執行環境、驗證系統論文。模型要面對足夠難的要求,環境得能執行,驗收也要與題目對應。

通用 Agent 的材料,來自內部員工和外部合作伙伴反饋的工作記錄、工具介面與失敗案例論文。團隊據此重建工具的輸入輸出格式和行為約束,讓模型可以在模擬環境中反覆練習實際工作裡出過錯的步驟。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

圖|DeepSeek 會不斷讀取圖片來檢查結果

以程式設計任務為例,有的 AI 負責出題、準備工作環境,有的負責試做,還有獨立的 AI 檢查題目和驗收要求是否一致、答案有沒有洩漏、能不能靠鑽漏洞過關論文。檢查不過,就修好題目再試。

任務用於新一輪強化學習後,解題軌跡又會成為重新稽覈題目質量的材料論文。某個測試如果一直誘導模型鑽空子,或者失敗源於環境配置而非能力,這些問題就需要回到任務生產環節處理。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

圖|在 DeepSeek Harness 的 Minimal 模式下,隨著強化學習(RL)訓練規模的擴大,模型在各項程式碼智慧體基準測試中的效能均有所提升論文

在 DeepSeek 的歸納中,這次後訓練的收益主要來自任務規模、多樣性和可驗證性的改善論文。模型做過更多型別的工作,也更頻繁地得到與結果相關的反饋。

工具軟體本身也會影響表現,DeepSeek 用不同工具框架測試同一個模型,發現系統提示、工具配置和歷史資訊管理的差異,都可能改變任務結果論文

DeepSeek 在報告中表示,後續會繼續擴大模型、資料和強化學習規模,並把模型與工具框架放在一起最佳化論文

V4.1-Flash 目前是這一新架構系列中最小尺寸的模型,未來的 V4.1-Pro 或許會延續這一架構,但從上次 V4 Pro 正式版的經歷來看,DeepSeek 顯然不會再輕易就釋出一款新的 Pro 模型論文

Agent 測試進步明顯論文,難題仍有差距

能力提升最集中地出現在 Agent 測試中論文

在 DeepSeek 公佈的最高推理檔位結果裡,V4.1-Flash 的 DeepSWE v1.1 軟體問題解決率達到 74.2%,上一代 Flash 為 54.4%,V4-Pro 為 62.7%論文。同一測試表格中的 Opus-5 為 74.0%,GPT-5.6 Sol 為 73.0%。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

Terminal-Bench 2.1 的成績從 82.7 升到 90.6;面向工作自動化的 AutomationBench,則從 37.7 升到 54.8,也高於同表中的 V4-Pro、Opus-5 和 GPT-5.6 Sol論文

最難的任務仍然拉得開距離論文。Terminal-Bench 4.0 上,新 Flash 從上一代的 7.0 提高到 31.2,但 Opus-5 為 51.8。在高難科學問答 GPQA Diamond 上,V4.1-Flash 的 90.9 也低於 V4-Pro 的 92.4。

原生視覺帶來了新的可用範圍,領先模型的優勢也還在論文。帶工具的專業圖表測試 Chartography 中,V4.1-Flash 得到 78.9,高於 Kimi K3 的 68.1,低於 Opus-5 的 84.0。

模型的表現,還會受 Agent 框架影響論文。同一個 V4.1-Flash,在最高推理檔位下,用 mini-SWE 跑 DeepSWE 得到 74.2,換成 Claude Code 為 69.8,Codex 為 65.6。系統提示、工具定義和上下文管理,都會影響模型能否把能力用出來。

另一方面,更長的思考也會增加賬單論文

DeepSeek 在強化學習中加入了隨推理檔位變化的長度懲罰,讓同一模型學會用不同長度的推理處理任務論文。API 提供 low、high、max 三檔,分別對應內部 50、75、100 的 effort 值。

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

圖|報告中的總體趨勢是,增加推理投入能改善成績,但圖表也出現了更高檔位得分下降的情況論文

在 V4 Flash 報告的結尾,DeepSeek 列了 7 條未來方向,包括架構精簡、訓練穩定性、稀疏嵌入、低延遲、長程 Agent、多模態,和資料合成,5 個月後 V4.1 似乎正逐條解決這些問題論文

扒完DeepSeek 最新論文,我發現了V4.1 Flash便宜大碗的秘密

模型可以更大,思考可以更長,工具也可以呼叫更多次論文。只要最終把任務做完所需要的視訊記憶體、延遲和總成本繼續下降,它就依然是一款更便宜的模型。

從 7 月底釋出 V4 Flash,到 8 月推出 V4 Pro,很快又更新了視覺推理預覽模型 Vision Exp,再到這兩天更新 V4.1 Flash,DeepSeek 的整體釋出節奏對比過去一年,似乎是前所未有的快論文

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://m.yxd-1688.com/post/83825.html

🌐 /