很多 AI 項目最先算錯的是任務分類。當項目啟動時,訓練、模型加載、檢查點寫入和在線請求很容易共用一套存儲方案。確實可以跑起來,讓團隊有機會把注意力放回模型和算力。但等訓練集開始擴容、服務請求持續(xù)進來,問題才露出來:有的數(shù)據(jù)等不得,有的數(shù)據(jù)占得太久,還有的數(shù)據(jù)會在幾周后重新變成高頻訪問對象。

WAIC 2026
WAIC 2026 的議程包括多模態(tài)科學智能體、具身空間交互和空天地智能計算等。圖像、傳感器信息、仿真結果與連續(xù)狀態(tài)記錄會進入同一個系統(tǒng),但它們的訪問方式并不相同。計算側需要及時拿到數(shù)據(jù);另一批資料則需要長期在線,等待下一輪訓練、分析或回溯調(diào)用。

閃迪參展WAIC 2026
這也是企業(yè)級AI存儲開始重新分工的原因,閃迪此次參展WAIC 2026, 旗下的SANDISK SN861 NVMe SSD和SANDISK SN670 NVMe SSD,提供了一個具體樣本:前者服務訓練、推理和 AI 服務部署,后者面向數(shù)據(jù)準備與AI數(shù)據(jù)湖。兩款SSD分別接住了兩種節(jié)奏截然不同的數(shù)據(jù)工作。
AI 項目最容易算錯的不是容量
企業(yè)采購存儲時,容量、接口和價格都容易寫進表格,數(shù)據(jù)在業(yè)務中的流動方式卻常常留到部署之后再處理。這個順序在小規(guī)模驗證階段問題不大;一旦進入生產(chǎn),訓練數(shù)據(jù)要持續(xù)讀取,模型和檢查點要反復寫入,線上服務還要接住隨時到來的請求,原先看似夠用的資源就會開始互相擠占。
WAIC 反復出現(xiàn)的多模態(tài)智能體和具身智能,放大了這種差異。一個系統(tǒng)既要處理圖像、文本和傳感器數(shù)據(jù),也要保留模型版本、實驗結果與運行記錄。部分內(nèi)容要立即進入計算側,部分資料隔幾周才會被重新調(diào)用,還有一些需要長期保存以便復盤。把它們都壓在同一層里,性能、容量和維護成本很快會彼此牽制。
容量只是存儲選擇的一項變量,訓練任務等待數(shù)據(jù)時,昂貴的計算資源無法發(fā)揮作用;長期留存的資料如果始終占在性能層,又會把更高成本的空間消耗在不緊急的內(nèi)容上。AI 項目開始規(guī)?;?,存儲需要先回答一件更實際的事:哪些任務必須優(yōu)先獲得 I/O,哪些資料可以留在容量層等待調(diào)用。
同一個 AI 項目里,存儲承擔兩種完全不同的工作
訓練和在線推理最怕 I/O 等待,數(shù)據(jù)集讀取、模型加載、檢查點寫入與在線請求的頻率并不一致,卻會同時壓向計算側。存儲鏈路一旦放慢,GPU 再貴,也不能替數(shù)據(jù)搬家。

SANDISK SN861 NVMe SSD
這類環(huán)境里,持續(xù)供數(shù)和持續(xù)寫入同樣重要。SANDISK SN861 NVMe SSD 采用 PCIe Gen5 接口,容量高達16TB,并提供1次或3次每日全盤寫入選擇。訓練數(shù)據(jù)會更新,檢查點需要反復保存,服務日志也在不斷寫入。DWPD 反映設備每天能夠承受多少次完整容量寫入,直接對應這類長期、反復發(fā)生的負載。
寫入壓力還來自 SSD 內(nèi)部,設備整理數(shù)據(jù)時會產(chǎn)生額外的數(shù)據(jù)搬移,實際寫入量可能高于應用提交的數(shù)據(jù)量。閃迪SN861 支持 FDP,通過更明確的數(shù)據(jù)放置減少盤內(nèi)搬移和寫入放大,降低持續(xù)寫入對性能穩(wěn)定性和設備壽命的影響。
PCIe Gen5 的價值需要放進整套系統(tǒng)里衡量,服務器平臺、網(wǎng)絡、文件系統(tǒng)和軟件調(diào)度仍會決定數(shù)據(jù)能否順利進入計算側。閃迪SN861 的 E1.S 版本已通過 NVIDIA GB200 NVL72 系統(tǒng)認證,U.2 與 E1.S 版本也獲得 OCP Inspired 認證;這些信息可用于相應服務器和開放計算環(huán)境的兼容性評估,系統(tǒng)級設計仍要結合具體部署完成。
對基礎架構團隊來說,這意味著選型不能停在峰值性能上。訓練階段的數(shù)據(jù)讀取、檢查點落盤和在線服務的突發(fā)請求,可能在不同時間把壓力推向同一組資源。把對時延最敏感的任務安排在靠近計算側的位置,先是為了減少等待,隨后才談得上把計算資源用得更充分。
計算側首先要處理數(shù)據(jù)及時抵達,另一批資料則在不斷積累。原始數(shù)據(jù)、中間結果、模型版本和運行記錄不必一直占用最高性能的資源,卻需要在下一次訓練開始時能夠被快速找到。過早轉入離線歸檔會拉長回調(diào)時間,長期占用性能層,也會持續(xù)推高容量成本。

SANDISK SN670 NVMe SSD
SANDISK SN670 NVMe SSD 基于 UltraQLC 平臺,單盤容量高達 256TB,面向 AI 數(shù)據(jù)湖和數(shù)據(jù)準備。它適合承接需要反復調(diào)用、但對訪問時延相對不敏感的數(shù)據(jù)。更多資料保持在線后,團隊可以減少在性能層與離線歸檔之間頻繁搬運數(shù)據(jù)。
數(shù)據(jù)湖并不是一處只進不出的倉庫,一次訓練結束后留下的樣本、標注結果和模型版本,可能在新的實驗里被重新篩選和組合;業(yè)務團隊也會回看歷史記錄,確認模型行為變化的原因。容量層的價值,正在于讓這類資料不必一直留在最貴的資源上,也不必每次調(diào)用都從離線介質(zhì)重新取回。
容量層有清晰的適用邊界,頻繁改寫和高并發(fā)請求仍需進入更匹配的性能層;容量層更適合規(guī)模持續(xù)增長、保存周期更長且仍有在線調(diào)用價值的資料。閃迪SN861與閃迪SN670放在同一套架構里,對應同一項目里兩段不同的數(shù)據(jù)路徑。
買了兩類盤,事情并沒有結束
硬件分層以后,難題轉到數(shù)據(jù)遷移上,哪些訓練數(shù)據(jù)繼續(xù)留在性能層,哪些實驗結果隨著訪問頻率下降進入容量層,不能靠設備自己判斷。遷移和調(diào)度規(guī)則缺位,數(shù)據(jù)仍可能滯留在不合適的層級,新的擁堵也會出現(xiàn)。
基礎架構團隊需要把這些規(guī)則放進日常運維:訓練集多久未被調(diào)用后再遷移,重新進入訓練時怎樣回遷,模型版本保留到什么階段,異常任務如何回退。存儲分層會增加設備種類,也會增加數(shù)據(jù)生命周期管理的工作量,規(guī)則還要隨著模型更新頻率和業(yè)務調(diào)用的變化持續(xù)調(diào)整。閃迪SN861 和閃迪SN670可以成為兩類任務的硬件基礎,架構如何組織仍由企業(yè)自己的業(yè)務節(jié)奏決定。
數(shù)據(jù)離開機房以后,判斷標準還會變化,手機端的本地模型、影像處理與內(nèi)容加載更接近日常使用體驗。SANDISK iNAND MC EU721 嵌入式閃存驅動器采用UFS 4.1接口,基于先進的SANDISK BiCS8 QLC 3D NAND技術打造,1TB 版本順序讀取和寫入速度分別為 4,500MB/s 與 4,300MB/s;Advanced RPMB隱私加密、設備健康異常監(jiān)測及HID碎片文件管理等功能,在保障高性能、高安全性和穩(wěn)定運行的同時,幫助確保設備長期使用的流暢體驗。

SANDISK iNAND MC EU721 嵌入式閃存驅動器
汽車的約束又不同,SANDISK iNAND AT EU752 UFS4.1嵌入式閃存驅動器面向智能網(wǎng)聯(lián)汽車和軟件定義汽車,是閃迪首款采用 UFS 4.1 標準的車規(guī)級嵌入式閃存產(chǎn)品。根據(jù)閃迪官方資料,閃迪EU752 的性能較其前代 UFS 3.1 產(chǎn)品提升超過兩倍;1TB 版本順序讀取和寫入速度分別為 4,300MB/s 與 4,100MB/s。持續(xù)寫入、可靠性和維護條件,需要從產(chǎn)品設計階段一并考慮。

SANDISK iNAND AT EU752 UFS 4.1 嵌入式閃存驅動器
WAIC 2026 展示了大量新模型和新硬件,真正進入生產(chǎn)的系統(tǒng)卻要面對更細碎的日常問題:數(shù)據(jù)有沒有及時送到計算側,歷史資料能否保持在線,遷移之后還能否在需要時回到正確的位置。模型能力和算力規(guī)模仍是競爭條件,存儲的職責則開始落到數(shù)據(jù)的流動和留存上。
訓練、推理和數(shù)據(jù)準備會長期并行。AI 存儲的比較也會從單盤參數(shù)轉向分層能力:硬件只是起點,數(shù)據(jù)調(diào)度和運維規(guī)則會更直接地影響算力利用效率與長期成本。

