今年4月底,由深圳國家超級計算中心(NSCC-SZ)開發的新一代百億億次級超算系統“靈晟”(LineShine)完成了全機測試。近期,相關論文正式曝光了該超算的具體架構與細節參數。由于其采用的是完全基于CPU處理器(未使用任何GPU加速器)的獨特技術路線,并且從處理器、存儲到互聯網絡均采用中國自主研發技術,峰值性能超過2EFlops,引發全球科技界對中國在芯片限制下突圍路徑的廣泛關注。
245萬個CPU核心,峰值性能超2ExaFlops
據介紹,LineShine系統由20,480個計算節點構成,每個節點搭載2顆基于ARMv9架構的LX2處理器,全系統總計40,960顆處理器、超過245萬個CPU核心。節點之間通過“靈渠”高速網絡互連,采用雙平面多軌胖樹拓撲結構,每個節點1.6 Tb/s的帶寬。
具體來說,每個LX2處理器內集成了兩個計算芯粒,總共304個CPU核心,分為8個集群,每個集群擁有38個CPU核心,每個核心配備32 KB的L1指令緩存和32 KB的L1數據緩存,而每個集群則共享一個28.5 MB的L2緩存。
所有CPU核心均支持Arm SVE(可伸縮向量擴展)和SME(可伸縮矩陣擴展),可直接高效處理FP64、FP32、BF16、FP16、INT8等多種數據格式的AI訓練與推理任務。每個LX2處理器在FP64/FP32精度下分別可提供高達60.3/120.6 TFLOPS的算力,在BF16/FP16精度下可提供240 TFLOPS算力,在INT8精度下可特供960 TOPS算力。

LX2還采用了類似日本“富岳”超算A64FX處理器的混合內存設計:每個LX2處理器集成了8個總計32GB容量HBM高帶寬內存,總帶寬達到4TB/s,同時支持最高256GB的片外DDR5內存。這種設計使得CPU可以在同一內存空間內處理海量科學數據集,避免傳統CPU-GPU異構架構中頻繁的數據搬運開銷。此外,芯片內置SDMA引擎,專門負責在HBM和DDR之間智能調度數據,這對于需要精細內存管理的AI訓練負載尤為關鍵。
整個LineShine系統包括47,000個CPU,分布在92個計算機柜中,擁有100萬端口互連,36個網絡機柜,67個存儲柜,428個存儲節點,10 TB/s存儲帶寬,總存儲容量650 PB。

在訓練63億參數的地球觀測生成壓縮模型時,LineShine系統BF16實際性能為1.543 ExaFLOPS,峰值性能可達2.166 ExaFLOPS。

國家超級計算深圳中心主任、“靈晟”系統總設計師盧宇彤表示,“靈晟”是世界首臺持續性能超2EFlops FP64的超級計算機,依托國產高性能CPU、片上高帶寬內存、高速互連網絡、高吞吐存儲、三維浮動正交、全液冷散熱等核心創新,實現架構、性能、能耗、編程、擴展性和可靠性六大技術突破,軟硬件全棧自主可控。其自研片上多精度混合計算加速框架和面向領域的超智融合軟件平臺可統一支撐科學計算、工程計算、智能計算“三算合一”,在分子動力學、流體仿真、生命科學、AI大模型訓推等大規模領域應用均實現國際領先性能。
為何選擇CPU-only路線?
當前超算系統普遍采用CPU+GPU異構計算架構。以馬斯克旗下xAI的Colossus集群為參考,其理論峰值性能高達約498 ExaFLOPS,即使按照約15%的實際利用率,也能提供約75 ExaFLOPS的有效算力,遠超LineShine系統的1.54 ExaFLOPS。此外,分析指出CPU-only系統在進行稠密AI計算時,其能效比和絕對算力密度通常低于專門的GPU加速器,這也是行業主流選擇“CPU+GPU”異構路線的主要原因。
但是,基于CPU-only系統的AI和高性能計算超級計算機相比傳統的異構CPU+GPU系統也有著多項優勢,尤其是在結合AI訓練與大規模數據攝取、預處理、存儲交互、仿真和編排的復雜科學任務中。
具體來說,由于CPU-only系統都運行在同一處理器和內存空間上,它們避免了異構計算帶來的許多復雜問題,比如昂貴且耗費帶寬的CPU到GPU數據傳輸、復雜的編程模型、GPU內存限制以及加速器專用的軟件棧。
CPU-only系統系統通過結合HBM和大容量DDR能力,可以擁有更大的連貫內存池,這對于處理海量的科學數據集、檢索增強生成和長上下文窗口非常有用。
CPU-only系統也適合涉及不規則控制流、分布式I/O、通信密集流水線以及執行模式不高效映射到GPU的科學人工智能應用。
此外,CPU-only系統可以更自然地與傳統高性能計算環境集成,執行常規超級計算機任務(如仿真),這對需要同時進行AI訓練/推理和高性能計算的需求尤為有用。
最后,在美國持續限制高端GPU對華出口的背景下,中國轉而發展CPU-only系統,擺脫了對英偉達GPU和CUDA軟件生態系統等國外加速器和平臺的依賴,實現了完全的自主可控。
深圳市科技創新局有關負責人在今年4月底介紹“靈晟”國產E級超級計算機系統時也表示,“靈晟”國產E級超算系統全面點亮并完成全機測試,是我國高端計算領域全棧自主可控的標志性成果。深圳正深入實施算力強基行動,構建全球領先的“通用算力+智能算力+超級算力”一體化體系。
需要指出的是,LineShine系統并非意在取代GPU超算集群,而是在特殊技術封鎖背景下,為保障國家戰略計算需求、探索自主技術路線而打造的關鍵“備份”與補充系統,尤其適用于將AI與大規模科學模擬、數據分析深度融合的“AI for Science”場景。

