《電子技術應用》
您所在的位置:首頁 > 人工智能 > 业界动态 > DeepSeek新论文剧透V4新框架

DeepSeek新论文剧透V4新框架

用闲置网卡加速智能体推理性能,打破PD分离瓶颈
2026-02-27
來源:IT之家

近日,DeepSeek北大、清華在ArXiv上發表了一篇論文,發布了一個全新的針對智能體的推理框架:DualPath

format,f_avif.avif (1).jpg

而且就跟前幾天曝出的算力話題相關。

DualPath 的核心在于解決 Agent 長文本推理場景下的 I/O 瓶頸,通過優化從外部存儲加載 KV-Cache 的速度,確保計算資源不被存儲讀取拖累。

它改變了傳統的存儲至預填充引擎(Storage-to-Prefill)單路徑加載模式,引入了存儲至解碼引擎(Storage-to-Decode)的第二條路徑。

通過利用解碼引擎閑置的存儲網卡(SNIC)帶寬讀取緩存,并配合高速計算網絡(RDMA)將其傳輸至預填充引擎,DualPath 實現了集群存儲帶寬的全局池化與動態負載均衡。

在 660B 規模的生產級模型的實測中,DualPath 表現驚人:

離線推理吞吐量提高了 1.87 倍,在線服務吞吐量平均提升 1.96 倍。

format,f_avif.avif (2).jpg

在高負載下,首字延遲(TTFT)大幅優化,而 Token 間的生成速度(TPOT)幾乎不受任何干擾。

接下來,我們一起來看。

雙路徑加載 (Dual-Path Loading)

總的來說,DualPath 是一個專門為智能體系統設計的推理框架,它的核心洞見是 ——

KV-Cache 的加載不必以預填充為中心。

在以往的理解中,誰負責計算誰就去搬數據。但 DualPath 認為,緩存可以先加載到解碼引擎中,再通過高性能 RDMA 網絡傳輸至預填充引擎。

通過在兩條路徑間動態選擇,DualPath 重新分配了網絡負載,緩解了預填充側的帶寬壓力。

那么,為什么要費這么大勁去“繞路”?

之所以這樣做,是因為在當前的智能體應用中,對話輪數多且上下文長,KV-Cache 命中率通常高達 95% 以上。

這意味著,每一輪對話都要搬運海量的“舊記憶”,推理性能的瓶頸已經從“計算”轉移到了“搬運”上。

format,f_avif.avif (3).jpg

在現有的預填充-解碼分離(PD-disaggregated)架構中,所有的加載任務都擁擠在預填充引擎(PE)的存儲網卡上,導致帶寬瞬間飽和;

與此同時,解碼引擎(DE)的存儲網卡卻在閑置,造成了嚴重的資源錯配。

format,f_avif.avif (4).jpg

更進一步的,當前 GPU 算力的增長遠快于網絡帶寬和 HBM 容量的增長,也加劇了 I/O 限制。

正如英偉達首席科學家 Bill Dally、谷歌架構師 Jeff Dean 等大佬反復強調的:計算是免費的,但數據移動是昂貴的。

針對這些問題,DualPath 構建了創新的雙路徑模型:

format,f_avif.avif (5).jpg

路徑 A(傳統):存儲 → PE,緩存直接讀入預填充引擎。

路徑 B(新增):存儲 → DE → PE,緩存先讀入解碼引擎的緩沖池,再通過 RDMA 傳輸給預填充引擎。

在架構組成上:

推理引擎:每個引擎管理一塊 GPU,嚴格區分為預填充(PE)和解碼(DE)。

流量管理器:負責 H2D/D2H 拷貝、引擎間傳輸以及 SNIC 存儲讀寫。

中央調度器:擔任“大腦”角色,實時決策每一條請求該走哪條路,從而實現全局帶寬的最大化利用。

核心技術方案:存儲至解碼路徑

如上所述,DualPath 推理系統的核心在于打破了傳統的“存儲至預填充”單路徑模式,創新性地引入了“存儲至解碼”路徑。

該設計允許 KV-Cache 先加載至解碼引擎(DE),再通過高帶寬計算網絡(RDMA)無損傳輸給預填充引擎(PE)。

通過在兩條路徑間動態分配負載,系統將集群中原本閑置的解碼側存儲網卡(SNIC)帶寬徹底釋放,構建起一個全局可調度的存儲 I/O 資源池。

具體來說,為了支持層級流式處理,DualPath 在 PE 和 DE 上均分配了少量 DRAM 緩沖區(PE / DE Buffer),并針對不同階段設計了精細的數據流:

PE 讀取路徑:命中 Token 的 KV-Cache 從存儲讀入 PE 緩沖區。在每層計算前,該層緩存傳輸至 PE HBM,與計算過程重疊執行。計算完成后,全量 KV-Cache 傳回 DE 緩沖區以形成完整上下文。

DE 讀取路徑: KV-Cache 直接進入 DE 緩沖區。在 PE 預填充期間,對應層的緩存跨節點傳輸至 PE HBM(計算重疊)。計算結束后,PE 僅需傳回新生成的 KV-Cache 片段與 DE 原有緩存合并。

解碼與持久化: DE 緩沖區接收完整 KV-Cache 后啟動解碼,執行 H2D 拷貝并隨后釋放 CPU 內存。雖然引入緩沖增加了 DRAM 壓力,但能顯著降低 GPU 顯存占用并優化首字延遲(TTFT)。生成過程中,每累積滿一個 Block(如 64 Token)即觸發異步持久化。

但就像前面提到的,“繞路”加載會帶來新問題:比如搬運緩存的流量撞上了模型計算的通信,怎么辦?

對此,DualPath 給出了兩套優化方案:

首先是以計算網卡(CNIC)為中心的流量管理,強制所有流量通過配對的 CNIC 走 GPUDirect RDMA 路徑。

在 InfiniBand 或 RoCE 網絡中,利用虛擬層(VL / TC)技術,將推理通信設為“最高優先級”并預留 99% 帶寬,讓緩存搬運只能在間隙中“蹭”帶寬,確保互不干擾。

其次是自適應請求調度器:調度器會盯著每個節點的磁盤隊列長度和 Token 數。系統會優先將任務分配給 I/O 壓力較小且計算負載較輕的節點,從根本上避免單側網卡或單點計算資源的擁塞。

在實驗階段,DualPath 在 DeepSeek-V3、Qwen 等模型上進行了測試,場景覆蓋了離線 Rollout 和在線服務。

如開頭所說,在離線推理中,DualPath 將端到端吞吐量提高了高達 1.87 倍,在線服務吞吐量平均提升 1.96 倍,顯著降低了首字延遲(TTFT),且保持了極其穩定的 Token 間延遲(TBT)。

總的來說,DualPath 證明了通過重新思考數據加載路徑可以有效突破當前大模型推理的 I/O 墻。

它成功利用了解碼引擎原本被浪費的 I/O 帶寬,配合自適應調度和嚴謹的流量隔離機制,在不增加硬件成本的前提下,大幅提升了智能體 LLM 推理系統的效率。

2.jpg

本站內容除特別聲明的原創文章之外,轉載內容只為傳遞更多信息,并不代表本網站贊同其觀點。轉載的所有的文章、圖片、音/視頻文件等資料的版權歸版權所有權人所有。本站采用的非本站原創文章及圖片等內容無法一一聯系確認版權者。如涉及作品內容、版權和其它問題,請及時通過電子郵件或電話通知我們,以便迅速采取適當措施,避免給雙方造成不必要的經濟損失。聯系電話:010-82306118;郵箱:aet@chinaaet.com。
主站蜘蛛池模板: 精品国产一区二区三区久久久狼 | 视频在线一区二区| 国产精品 日韩| 中文字幕精品一区日韩| 日韩在线小视频| 欧美亚洲激情视频| 91久久国产综合久久91精品网站 | 国产超碰91| 两个人的视频www国产精品| 三级三级久久三级久久18| 丝袜美腿亚洲一区二区| 91精品国产高清久久久久久久久 | 91精品免费视频| 欧美交换配乱吟粗大25p| 久久久久国色av免费观看性色| 久久99国产综合精品女同| 激情婷婷综合网| 国产精品国产三级国产专播精品人| 亚洲乱码一区二区三区| 91国产精品91| 中文字幕人成一区| 欧日韩不卡在线视频| 欧美精品第三页| www久久99| 久久免费精品视频| 亚洲图片在线观看| 日韩欧美一区二区三区四区五区| 欧美中文字幕精品| 亚洲综合av一区| 日韩av不卡播放| 亚洲综合中文字幕在线| 不卡av电影在线观看| 五月天综合婷婷| 99精品视频在线看| 国产一区二区色| 日韩久久久久久久久久久久| 人人妻人人澡人人爽精品欧美一区| 欧洲亚洲免费视频| 久久免费福利视频| 欧美少妇一区| 91久久久亚洲精品|