4 月 30 日消息,科技媒體 Wccftech 昨日(4 月 29 日)發(fā)布博文,報(bào)道稱英特爾和 AMD 聯(lián)合發(fā)布人工智能計(jì)算擴(kuò)展(ACE)白皮書(shū),將其定位為 x86 架構(gòu)的標(biāo)準(zhǔn)矩陣加速方案。
現(xiàn)有 AVX10 等 SIMD 擴(kuò)展雖能處理矩陣運(yùn)算,但在計(jì)算密度與擴(kuò)展性上存在局限,ACE 正是為突破這一瓶頸而生。
ACE 作為 x86 指令集的關(guān)鍵擴(kuò)展,核心目標(biāo)是大幅提升矩陣乘法性能、擴(kuò)展性與能效。矩陣乘法作為神經(jīng)網(wǎng)絡(luò)與大語(yǔ)言模型的核心計(jì)算模塊,其效率直接決定 AI 工作負(fù)載的表現(xiàn)。
技術(shù)層面,ACE 引入基于外積運(yùn)算(outer product operation)的矩陣加速機(jī)制,無(wú)縫集成 AVX10。白皮書(shū)數(shù)據(jù)顯示,在消耗相同數(shù)量輸入向量的前提下,ACE 外積運(yùn)算的計(jì)算密度比等效的 AVX10 乘加運(yùn)算(multiply-accumulate operation)高出 16 倍。

ACE 在底層計(jì)算方面,支持 INT8、OCP FP8、BF16 等主流 AI 數(shù)據(jù)格式,其設(shè)計(jì)兼顧靈活性與擴(kuò)展性,旨在構(gòu)建覆蓋筆記本電腦到超級(jí)計(jì)算機(jī)的全場(chǎng)景矩陣加速框架。

在軟件生態(tài)方面,ACE 集成低精度 GEMM 等深度學(xué)習(xí)和高性能計(jì)算庫(kù),并啟動(dòng)適配 NumPy、SciPy 等 Python 庫(kù)以及 PyTorch、TensorFlow 等主流機(jī)器學(xué)習(xí)框架。

