7月19日消息,“云天勵飛”公眾號發(fā)文,云天勵飛在2026 WAIC上正式披露了未來兩年AI推理芯片的路線圖,計劃推出DeepVerse 100P、100D和100L三款云端大算力芯片,分別針對Prefill、Decode及Decode內(nèi)部FFN環(huán)節(jié)的負載特征進行專用優(yōu)化。

當前,大模型推理應用正加速分化為三類典型場景:以對話和知識問答為代表的通用AI助手,以復雜推理和編程為代表的深度推理應用,以及以Agentic Coding、多智能體協(xié)同為代表的實時智能體系統(tǒng)。
隨著應用不斷深入,單次任務的上下文長度、推理鏈路復雜度與實時響應要求持續(xù)攀升,對推理系統(tǒng)的吞吐能力、延遲控制和成本效率提出更高挑戰(zhàn)。在大規(guī)模部署中,峰值算力已難以單獨衡量系統(tǒng)效能,計算、訪存、互聯(lián)與調(diào)度等因素共同決定著Token生成的成本與質(zhì)量。
與此同時,大模型推理不同階段的計算特征日趨分化。Prefill階段需集中處理長輸入上下文,對算力要求極高;Decode階段以逐Token生成方式運行,對內(nèi)存帶寬和訪存效率更為敏感;而隨著MoE等模型架構的普及,Decode內(nèi)部的Attention與FFN子模塊在計算密度與訪存模式上也呈現(xiàn)出顯著差異。

傳統(tǒng)“一芯通吃”的混部架構,往往因資源共享導致資源爭搶,制約整體效率。
基于這一洞察,云天勵飛設計了三款專用芯片,并面向萬卡異構集群進行協(xié)同部署,通過對推理階段的解耦,為不同環(huán)節(jié)分配最適配的算力資源,系統(tǒng)化降低Token生成成本。
DeepVerse 100P:專為百萬級上下文Prefill場景打造,避免與Decode共享算力和帶寬,消除長上下文處理對生成吞吐的影響。
DeepVerse 100D:面向Decode環(huán)節(jié)的專用推理引擎,提供數(shù)倍于主流芯片的內(nèi)存帶寬,支持1024卡級Scale-up及光互聯(lián)架構。通過按需動態(tài)建立光路直連,并依據(jù)任務實時重構鏈路,大幅減少傳統(tǒng)多跳電交換中的排隊、擁塞和中間轉(zhuǎn)發(fā)開銷,降低通信尾延遲,保障逐Token生成的穩(wěn)定輸出。
DeepVerse 100L:針對Decode階段中計算密集型的FFN環(huán)節(jié),采用3D Memory架構,相比主流HBM顯著提升帶寬;配合低延遲芯片互聯(lián)和激活數(shù)據(jù)快速傳輸,提高計算與通信的并行效率。
三款芯片協(xié)同配合,有望在推理全鏈路中實現(xiàn)更精細的資源匹配,為未來AI應用的規(guī)模化落地提供高效、低成本的算力底座。


