7 月 22 日消息,英偉達(dá)昨日(7 月 21 日)發(fā)布博文,從技術(shù)角度詳細(xì)介紹了 Vera CPU,專為智能體 AI(Agentic AI)場(chǎng)景設(shè)計(jì)。

英偉達(dá)表示智能體 AI 將更多的關(guān)鍵執(zhí)行路徑轉(zhuǎn)移到了 CPU 上。智能體(Agents)在沙箱中運(yùn)行代碼、調(diào)用工具、檢索上下文、與數(shù)據(jù)庫(kù)交互以及分析結(jié)果,然后再將信息返回給模型。
援引博文介紹,智能體 AI 工作負(fù)載主要取決于以下幾點(diǎn):
即使插槽完全負(fù)載,也需要強(qiáng)大的單線程性能。
每個(gè)核心都有足夠的內(nèi)存帶寬,以持續(xù)為許多活躍的執(zhí)行上下文提供數(shù)據(jù)。
并發(fā)下的延遲具有可預(yù)測(cè)性,以便智能體能夠穩(wěn)定完成預(yù)定步驟。
高效處理不規(guī)則控制流、長(zhǎng)依賴鏈和指針密集型數(shù)據(jù)結(jié)構(gòu)。
英偉達(dá)在博文中強(qiáng)調(diào),Vera CPU 圍繞智能體 AI 負(fù)載設(shè)計(jì),重點(diǎn)提升滿負(fù)載條件下的單線程表現(xiàn),其設(shè)計(jì)核心是 Olympus 核心。
英偉達(dá)強(qiáng)調(diào) Olympus 核心采用前端、核心中段、執(zhí)行引擎和緩存子系統(tǒng)四部分設(shè)計(jì)。前端集成 10 寬解碼引擎,并支持每周期最多處理 2 個(gè)已采用分支。其分支預(yù)測(cè)子系統(tǒng)包含神經(jīng)分支預(yù)測(cè)器,用于提升復(fù)雜分支模式下的預(yù)測(cè)準(zhǔn)確性。

該公司表示,Vera CPU 共配備 88 個(gè) Olympus 核心和 176 個(gè) SMT 線程,目標(biāo)是在單線程高負(fù)載與更高線程密度兩類場(chǎng)景間切換,并降低線程間資源爭(zhēng)用。
在片上互連與緩存部分,Vera CPU 搭載 NVIDIA 可擴(kuò)展相干互連,即 NVIDIA Scalable Coherency Fabric(SCF)。

NVIDIA 稱,這一互連提供最高 3.4 TB/s 雙向分區(qū)帶寬,并在全核心范圍內(nèi)集成 164 MB 統(tǒng)一 L3 緩存,連接核心、共享緩存、內(nèi)存控制器、I/O 與 NVLink-C2C 接口。
內(nèi)存方面,Vera CPU 采用 SOCAMM2 LPDDR5X 內(nèi)存。NVIDIA 稱,該子系統(tǒng)聚合帶寬最高 1.2 TB/s,按單核計(jì)算最高 14 GB/s,面向高并發(fā) AI、分析、圖計(jì)算與強(qiáng)化學(xué)習(xí)負(fù)載供數(shù)。


擴(kuò)展與 I/O 方面,NVIDIA 稱 Vera CPU 支持雙路擴(kuò)展,通過(guò)第二代 NVLink-C2C 構(gòu)建一致性雙路平臺(tái)。
雙路配置下,平臺(tái)提供 176 條 PCIe 6.4 通道,并支持 CXL 3.1。保密計(jì)算方面,Vera CPU 基于 Arm CCA / RME,支持按虛擬機(jī)分配加密密鑰,并使用經(jīng)認(rèn)證的 C2C 加密保護(hù)一致性鏈路數(shù)據(jù)。



