《電子技術應用》
您所在的位置:首頁 > 人工智能 > 业界动态 > 昇腾910C成功完成万亿DeepSeek全参数后训练

昇腾910C成功完成万亿DeepSeek全参数后训练

2026-06-08
來源:快科技

6月7日消息,這兩天國產AI芯片最重磅的消息,沒有之一。

s_efc8fb12637b4938bb021c836d419bc4.png

6月5日上午,深圳發布官方賬號率先發布通報,正式確認了這個讓整個行業振奮的消息。近日,深圳河套學院AI訓練平臺項目團隊,聯合哈爾濱工業大學(深圳)、深圳市大數據研究院、華為有關團隊,協同深智城AI算力平臺,面向國產算力大模型訓練開展聯合攻關。依托昇騰910C國產AI算力集群,完成1.6萬億參數大模型DeepSeek-V4-Pro全參數后訓練。

消息一出,國內科技媒體第一時間跟進。當天,南華早報等海外主流科技媒體也跟進報道,稱這一進展標志著在美國制裁持續收緊的背景下,中國半導體行業正努力從支持基礎AI推理,邁向更復雜的模型訓練階段。

s_a05286fdfe504a548e12d10e01661845.png

深圳發布在報道中明確指出,"此次實踐為全球第三方機構在國產算力平臺上完成該級別模型訓練的相關探索,積累了重要經驗,也印證了國產AI芯片可支撐世界級超大參數模型訓練工作"。

但在我看來,這不是一次試探性的嘗試,而是一次里程碑式的技術突破。它用無可辯駁的工程結果證明,國產AI芯片已經跨過了那條最難的門檻。

先搞懂這幾個詞

很多人看新聞只記住了"1.6萬億參數"這個數字,卻沒搞懂"全參數后訓練"這六個字的分量。

AI大模型從誕生到能用,其實就兩個核心階段:訓練和推理。

推理:運行一個已經訓練完成的模型來處理用戶請求。這個過程中模型的所有參數都是固定不變的,只是利用已學到的知識生成輸出。推理對算力的要求相對較低,更看重延遲、吞吐量和能效比。這也是國產芯片此前最擅長的領域,國內市場上已有大量AI應用采用國產推理芯片部署。

訓練:通過輸入海量數據,不斷調整模型內部參數,讓模型學會新知識和新技能的過程。訓練的難度和算力需求與推理不在一個量級,通常需要數千甚至數萬張芯片組成的集群連續運行數周甚至數月。

訓練又分為兩個關鍵階段:

預訓練:大模型的基礎階段。給模型喂入萬億級別的文本、圖像等多模態數據,讓它掌握基本的語言能力、世界知識和通用邏輯。

后訓練:在預訓練的基礎上,通過人類反饋強化學習(RLHF)、監督微調(SFT)等技術,讓模型學會遵循人類指令、遵守安全規則、完成特定任務。這是決定大模型實際使用體驗的關鍵環節。

全參數后訓練:指在訓練過程中更新模型的全部參數,而不是只更新其中一小部分。對于DeepSeek-V4-Pro來說,就是要同時調整它的1.6萬億個參數。與之相對的是"部分參數微調",只更新模型的最后幾層或者少量適配器參數。全參數訓練能夠最大限度地提升模型性能,但也對算力、存儲、通信和系統穩定性提出了近乎苛刻的要求。

深圳發布的那個比喻特別形象:如果把訓練一個萬億級參數的AI大模型比作解一道超級復雜的數學題,那么每一張計算卡就像一名解題員。他們不僅要分工明確、日夜不停地連軸轉,還不能有人偷懶、不能有人出錯,更不能有人掉隊。

"以前的國產算力更多是讓大模型'能用',也就是推理部署,就像給模型修了一條單行道,輸入一個問題,輸出一個答案。"

而全參數后訓練,"是要讓模型學會自我反思和調整,相當于在單行道的基礎上,又增加了復雜的立交橋和多條反饋回路,計算量和通信量瞬間翻了好幾倍。"

而且DeepSeek-V4-Pro用的還是現在最主流的混合專家(MoE)架構,這就更難了。可以把它想象成一個龐大的“專家團”,平時推理的時候,只需要激活少數幾個"專家"來回答問題。但訓練的時候,所有專家都要同時學習,還要互相通信同步信息。光是專家之間的數據交換量,就是普通模型的幾十倍。

這也是為什么之前業內普遍認為,國產芯片根本扛不住這么大的全參數訓練。

s_f742538088d44dd4a1591667a678c5ac.png

這次能成靠的是三個實打實的工程突破

面對這么大的挑戰,這次團隊沒有搞什么花里胡哨的概念,就是靠三個扎扎實實的工程突破,把不可能變成了可能。

第一個是"顯存拼圖"。1.6萬億個參數的數據量極其龐大,不可能塞進任何一張單獨的計算卡。團隊設計了一套極其精密的分布式承載方案,把整個模型像拼圖一樣,拆成一小塊一小塊,精確地分配到每一張芯片上。哪塊卡負責哪部分參數,什么時候需要和其他卡交換數據,都算得絲毫不差。

第二個是"負載均衡"?;旌蠈<夷P妥铑^疼的問題就是忙閑不均。有的專家任務排成長隊,有的專家卻閑得沒事干。之前很多國產集群跑MoE模型,算力利用率普遍偏低。這次團隊專門針對MoE架構優化了調度算法,動態給每個專家分配任務,徹底解決了跨卡通信擁堵的問題。

第三個是"全程不掉線"。做過大模型訓練的人都知道,最怕的就是跑了幾天幾夜,突然一個硬件故障或軟件錯誤,整個訓練直接崩潰,前面所有的時間和算力都打了水漂。這次訓練一共跑了1500多步,全程沒有出現一次中斷或者報錯。這背后是一整套完整的全鏈路監控和容錯體系,是無數個日夜調試出來的結果。

最后官方公布的數據是,模型算力利用率超過30%,關鍵訓練算子效率提升14%??赡苡腥擞X得30%不高,但在大模型訓練領域,這已經是非常不錯的工業級水平。要知道,就算用最頂級的海外芯片,很多團隊的實際利用率也就在40%左右。

s_051c12b4985643ed96e4cdac17b8db9d.png

比技術突破更重要的是我們終于有了自己的練兵場

很多人討論這次突破,都只盯著芯片本身。但在我看來,這次事件最被低估的價值,其實是人才培養。

深圳河套學院這次沒有把這個項目當成一個單純的技術攻關,而是把它變成了一個活生生的課堂。他們讓學生直接進入真實的訓練場景,從最基礎的環境搭建開始,全程參與整個訓練過程。

截至目前,這個項目已經培養了42名學生,形成了青年教師指導、博士生核心攻堅、工程團隊支撐的完整梯隊。這些人不是在課本上學大模型訓練,而是真刀真槍地跑過萬億級模型的全流程。他們知道哪里會出問題,知道怎么解決問題,這才是國產AI產業最寶貴的財富。

很多人說國產AI缺芯片,其實更缺的是真正有實戰經驗的工程師。大模型訓練是一門工程科學,很多東西是書本上學不到的,必須親手跑過才能明白。之前我們沒有自己的高端算力平臺,很多年輕人連摸一下萬億級集群的機會都沒有?,F在這個局面,終于被打破了。

當然,我們必須清醒地認識到,國產算力和世界頂尖水平之間還有不小的差距。無論是單卡性能,還是整個軟件生態的完善程度,我們都還有很長的路要走。

但這次突破的意義,怎么強調都不為過。它證明了一件事:在大模型訓練這個曾經被海外壟斷的領域,我們不僅能做,而且能做得很好。它給整個行業注入了信心,也給所有正在這條路上努力的人,點亮了一盞燈。

深圳發布在通報的最后說,接下來,深圳河套學院將聯合生態伙伴持續優化算力集群性能,圍繞長文本處理、AI智能體等方向開展技術探索,持續挖掘國產算力應用潛力。

我相信,這只是一個開始。當越來越多的團隊開始用國產芯片訓練大模型,當整個生態慢慢成熟起來,國產AI產業一定會迎來屬于自己的時代。

2.jpg

本站內容除特別聲明的原創文章之外,轉載內容只為傳遞更多信息,并不代表本網站贊同其觀點。轉載的所有的文章、圖片、音/視頻文件等資料的版權歸版權所有權人所有。本站采用的非本站原創文章及圖片等內容無法一一聯系確認版權者。如涉及作品內容、版權和其它問題,請及時通過電子郵件或電話通知我們,以便迅速采取適當措施,避免給雙方造成不必要的經濟損失。聯系電話:010-82306118;郵箱:aet@chinaaet.com。
主站蜘蛛池模板: 欧美日韩电影在线观看| 日本久久中文字幕| 日本精品一区| 午夜精品久久久久久久男人的天堂| 欧美精品在线播放| 99在线热播| 国产精品美女久久久久久免费| 免费人成在线观看视频播放| 久久精品视频在线观看| 国产精品入口尤物| 国产suv精品一区二区| 亚洲免费精品视频| 亚洲精品中文字幕乱码三区不卡| 国产欧美日韩91| 无码无遮挡又大又爽又黄的视频| 久久国产精品久久久久久久久久 | 97成人精品视频在线观看| 亚洲欧美日韩精品综合在线观看| 国产精品免费久久久久影院| 日韩在线视频观看正片免费网站| 国产在线观看不卡| 日韩中文字幕av在线| 国产精品av电影| 国产在线精品一区| 国产欧美在线观看| 日本一区二区三不卡| 视频一区亚洲| 国产欧洲精品视频| 国产精品视频自在线| 激情小说综合区| 国产精品流白浆视频| 久久久久久久久久久av| 久久精品美女| 国产精品美女呻吟| 亚洲专区在线视频| 亚洲一区中文字幕在线观看| 国产精品一区在线观看| 国产精品久久久久国产a级| 国产成人精品a视频一区www| 欧美激情中文网| 性欧美精品一区二区三区在线播放V|