6月28日消息,當行業(yè)在討論誰的模型更聰明時,DeepSeek仍然把目光投向更現(xiàn)實的問題:如何讓大模型跑得更快。
昨日,DeepSeek官方在Github低調(diào)發(fā)表了一篇最新論文,介紹其推理加速框架DSpark,試圖解決大語言模型在高并發(fā)場景下的推理效率瓶頸。
從作者署名來看,這篇論文由DeepSeek與北京大學聯(lián)合發(fā)布,值得注意的是,DeepSeek創(chuàng)始人梁文鋒也位列作者名單。
在論文中,團隊開源了DSpark模型權(quán)重,并同步發(fā)布了面向推測解碼、由算法驅(qū)動的訓(xùn)練代碼倉庫DeepSpec。
DeepSeek首先解釋了需要解決的問題。大語言模型采用自回歸方式生成文本:每一個新詞元的生成,都需要基于全部前置詞元完成一次完整前向傳播,結(jié)果是輸出越長,等待越久。
由此帶來GPU利用率低下、用戶等待時間過長的問題,這是大語言模型線上服務(wù)的核心性能瓶頸,在實時對話助手、多輪智能體工作流等低時延敏感場景中尤為突出。
目前的主流方案分為自回歸草稿模型(Eagle3)、并行草稿模型(DFlash)兩條路線,二者各有缺陷,包括生成質(zhì)量瓶頸和系統(tǒng)效率瓶頸等,且現(xiàn)有方案均缺乏負載自適應(yīng)校驗機制。
基于此,DeepSeek提出DSpark推測解碼框架,采用半自回歸生成架構(gòu):保留并行主干的高吞吐優(yōu)勢,同時加入輕量級串行模塊,逐詞元注入前綴依賴信息。
該模塊提供兩種實現(xiàn)——僅依賴前一個詞元的馬爾可夫頭,以及通過循環(huán)狀態(tài)累積完整前綴信息的RNN頭。
實驗表明,兩層Transformer深度的DSpark即可在所有測試領(lǐng)域超過五層DFlash的接受長度。
目前,DeepSeek已經(jīng)將DSpark部署到DeepSeek-V4在線服務(wù)系統(tǒng)中,并基于真實用戶流量評估其實際性能。
結(jié)果顯示,相較于現(xiàn)有生產(chǎn)環(huán)境基線系統(tǒng)MTP-1,在相同吞吐量條件下,DSpark將用戶端生成速度提升了60%-85%。
此外,DeepSeek也將這一框架部署在其他模型上,以阿里旗下的Qwen3-4B、8B、14B三個模型為例,相較于自回歸草稿模型,DSpark平均單輪可接受詞元長度分別提升了30.9%、26.7%、30%;相較于并行草稿模型,DSpark分別提升了16.3%、18.4%、18.3%。

