久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**AI推理爆發(fā)使NAND從“大宗商品”蛻變?yōu)椤癟oken電池”,數(shù)據(jù)中心需求2026年將歷史性反超智能手機;KV Cache卸載、Staging和Fast Data Lake三類負(fù)載驅(qū)動2030年AI數(shù)據(jù)中心NAND出貨達(dá)1.2ZB,NAND行業(yè)有望打破“硅周期”宿命。** **要點** **1. 需求結(jié)構(gòu)發(fā)生質(zhì)變** 數(shù)據(jù)中心NAND需求占比將從2025年約30%躍升至2026年約45%,歷史性反超智能手機。AI推理需求CAGR高達(dá)56%,是訓(xùn)練的5倍,成為本輪超級行情的主導(dǎo)力量。 **2. KV Cache卸載創(chuàng)造全新增量** 長文本時代讓KV Cache從“算完即棄”變?yōu)槌志没鎯Γミ_(dá)ICMS架構(gòu)將其定義為AI原生數(shù)據(jù)。NAND作為“Token電池”,存KV Cache可節(jié)省GPU算力和電費,復(fù)用2次即可盈虧平衡,Agent場景命中率超95%。 **3. 三類核心負(fù)載明確分工** Staging暫存層(占比40%)由TLC/pSLC壟斷,應(yīng)對極高寫入強度;KV Cache卸載層(占比35%)由TLC/QLC梯次承接;Fast Data Lake(占比25%)由QLC主攻讀取。TLC與QLC分別向“更快更耐用”和“更便宜”兩極分化演進(jìn)。 **4. 供給側(cè)邏輯逆轉(zhuǎn)打破硅周期** 云廠商從“短期壓價”轉(zhuǎn)向“長期保供”,NBM長協(xié)模式成為基石。NAND從外圍零件升級為“計算路徑上的必需品”,與GPU算力部署綁定,擺脫了此前“供過于求→減產(chǎn)→漲價→擴產(chǎn)”的死循環(huán)。
從綠葉到鮮花,AI 推理如何為NAND“逆天改命”?
2026-09-30 19:11

從綠葉到鮮花,AI 推理如何為NAND“逆天改命”?

本文來自微信公眾號: 海豚研究 ,作者:海豚君,原文標(biāo)題:《從綠葉到鮮花,AI 推理如何為 NAND“逆天改命”?》


NAND是一個被“技術(shù)詛咒”的行業(yè):正如海豚君在前篇《NAND天性“多產(chǎn)”,閃迪憑什么守80%毛利率?》中所說,AI爆發(fā)前的NAND就是典型的大宗生意——產(chǎn)能由市場無情出清,技術(shù)領(lǐng)先換不來溢價,只能“虧得比別人少”,銷量增長的紅利被降價全部吞噬。


根源在供給端太多產(chǎn):靠單一晶圓上向上堆疊、橫向縮孔,從BiCS5到BiCS11五代,閃迪每片晶圓的bit產(chǎn)出每代增加54%,年化復(fù)合約27%。


也就是說,哪怕一分錢擴產(chǎn)(CapEx)不花,bit產(chǎn)能每年也會自動膨脹近三成。3D轉(zhuǎn)型期更是一次性猛增,供給一度遠(yuǎn)超需求,這讓“輕資產(chǎn)”NAND生意在下行周期比“重資產(chǎn)”DRAM更慘烈。


而AI的爆發(fā),正在重寫NAND的劇本。本篇報告中,海豚君重點關(guān)注AI浪潮究竟給NAND下游需求帶來了怎樣的結(jié)構(gòu)性重塑?


以下為詳細(xì)分析


1.AI浪潮究竟給NAND下游需求帶來了怎樣的結(jié)構(gòu)性重塑?


AI之前的消費電子周期中,“話事”需求場景——手機、PC、傳統(tǒng)服務(wù)器等核心下游增長平穩(wěn)可預(yù)期,缺乏爆發(fā)變量,所以周期的大起大落,實質(zhì)由供給端的無序擴產(chǎn)與急劇收縮主導(dǎo)。


需求增長來自三大動能:單機容量升級、新興市場滲透,以及固態(tài)硬盤(SSD)對機械硬盤(HDD)的存量替代,緩步而穩(wěn)定。


穩(wěn)定的需求,配上剛性提升供給,導(dǎo)致NAND屬性被困在經(jīng)典的“硅周期”中:供過于求、價格暴跌→原廠減產(chǎn),低價同時刺激單機容量升級→供需再平衡、價格回升→原廠在高利潤下追高擴產(chǎn)→再次陷入產(chǎn)能過剩。


只要NAND擺脫不了“外圍零件”的定位,這個死循環(huán)就打不破。唯一出路,是出現(xiàn)一個不太看價格、且與GPU算力部署直接綁定的新場景——這正是后來AI浪潮所扮演的破局者角色。





第二階段(2025年之后):AI推理驅(qū)動的結(jié)構(gòu)性爆發(fā)


2026年是NAND歷史上最具標(biāo)志性的分水嶺:數(shù)據(jù)中心占NAND總需求的比重,從2025年約30%躍升至2026年約45%,歷史性反超智能手機(同期收縮至約23%),成為最大終端基本盤。


驅(qū)動NAND需求的主角,從對價格高度敏感、庫存大起大落的消費電子,換成了以TCO(總擁有成本)和算力回報(ROI)做決策、對價格脫敏的云服務(wù)商。


云廠商關(guān)心的不再是“這季度顆粒夠不夠便宜”,而是“能否按時拿到足額的高性能eSSD,保證未來三年GPU基建不掉鏈子”。從“短期壓價”轉(zhuǎn)向“長期保供”,正是原廠推行NBM(新型長協(xié)模式)的需求側(cè)基石。


伴隨基本盤切換,AI重心“由訓(xùn)轉(zhuǎn)推”,更讓NAND的角色質(zhì)變:


AI早期,NAND只是外圍的“數(shù)據(jù)倉庫”:把訓(xùn)練語料、模型權(quán)重、防宕機的Checkpoint(存檔)等靜態(tài)數(shù)據(jù),放在GPU能快速調(diào)取的近端。這些數(shù)據(jù)可替代性極強——丟了從數(shù)據(jù)湖重新下載即可,只花帶寬和極少電費,不必動用昂貴GPU重算。


但推理時代,計算變成高并發(fā)、持續(xù)性的“動態(tài)消耗”——存儲需求與“AI用戶數(shù)×使用頻次×上下文長度”強綁定。更關(guān)鍵的是,NAND首次存儲“計算的中間產(chǎn)物”。


長文本推理產(chǎn)生的龐大KV Cache不是外部搬來的靜態(tài)數(shù)據(jù),是GPU大量消耗算力后生成的“工作記憶”。它一旦丟失,中央倉庫沒有備份,只能再花昂貴的GPU算力和電費重算。


存儲的價值第一次可以直接折算成“算力與電費”。正如閃迪所說——SSD本質(zhì)上已經(jīng)進(jìn)化為一塊“Token電池”:Token是已經(jīng)做過的功,與其丟棄重算,不如“充”入硬盤;存KV Cache就是幫云廠商省電、省算力。


鎧俠的預(yù)測也印證了這一趨勢:數(shù)據(jù)中心NAND總需求將從2025年的286 EB增至2031年的1,686 EB(CAGR 34%),且內(nèi)部結(jié)構(gòu)極度分化:


AI推理:從2025年的86 EB激增至2031年的1,251 EB,CAGR高達(dá)56%;占數(shù)據(jù)中心NAND需求的比例也從30%攀升至74%。


AI訓(xùn)練與傳統(tǒng)負(fù)載:同期AI訓(xùn)練的CAGR僅11%,傳統(tǒng)云工作負(fù)載(以CPU為主)僅14%。


推理需求的增速是訓(xùn)練的5倍——本輪NAND超級行情,將主要由推理需求的爆發(fā)主導(dǎo)。





先看NAND在AI數(shù)據(jù)中心的主要應(yīng)用:


①KV Cache卸載——NAND成GPU的上下文存儲層


AI推理時,GPU必須為每個Token實時計算并維護(hù)KV Cache(模型的“工作記憶”)。但早期架構(gòu)中它是“算完即棄”的消耗品:一輪對話結(jié)束,或GPU要騰顯存服務(wù)下一個用戶,HBM里的KV Cache就被清空。


于是用戶一旦追問,或多人并發(fā)調(diào)用同一份超長文檔,系統(tǒng)只能把上下文重新喂給GPU,從頭做一次昂貴的Prefill(預(yù)填充)。


Prefill是推理第一步:GPU一口氣通讀全部輸入、算清Token間的關(guān)聯(lián)(Attention機制),再生成一遍KV Cache——這是整個推理中最吃算力、最費電的環(huán)節(jié)。




過去“用了就丟”,是因為兩筆賬算不過來:


a.重算比存起來更便宜:早期(如GPT-3時代)上下文只有2K Tokens,KV Cache很小,GPU零點幾秒就能重算完;而存進(jìn)硬盤要經(jīng)CPU和內(nèi)存中轉(zhuǎn)、在PCIe上“折返跑”,來回耗時甚至超過重算。


b.HBM又小又貴:GPU自帶顯存“寸土寸金”,必須留給當(dāng)前活躍的計算任務(wù),不可能長期保管已下線用戶歷史記憶。


但長文本時代推翻了這筆賬:從2020年GPT-3的2K Token到2026年主流模型的百萬級上下文,六年暴漲500倍。重算一次百萬Token的KV Cache,要讓昂貴的GPU滿載跑好幾秒,有算力與電費代價。


這直接促成KV Cache的“再定性”:英偉達(dá)ICMS(推理上下文內(nèi)存存儲)架構(gòu),正式把它從“算完即棄的臨時緩存”改定義為“AI原生持久數(shù)據(jù)”。



現(xiàn)在,臨時緩存變長久緩存,這個賬是否算得過來?


a.容量約束:算法壓縮也趕不上KV Cache膨脹速度


第一個條件,是HBM的擴容速度遠(yuǎn)追不上KV Cache的膨脹。


KV Cache總量=上下文長度×并發(fā)會話數(shù)×單Token存儲量。目前,前兩個變量都在被急劇放大:


上下文長度每年翻倍以上:主流模型從4K、128K快速演進(jìn)到1M+,KV Cache隨之線性放大。


并發(fā)與推理輪次爆發(fā)——正被三種應(yīng)用架構(gòu)急劇放大:


a.RAG(檢索增強生成):問一句話,后臺塞進(jìn)兩本書。系統(tǒng)把檢索到的大量文檔拼接到輸入端,送進(jìn)GPU的Token遠(yuǎn)超原始提問,單次任務(wù)的KV Cache直接拉爆。


b.Agentic Search:AI從“一問一答”變成自主循環(huán)的“規(guī)劃—調(diào)用—評估—再檢索”。多步任務(wù)把單次Token消耗從數(shù)百個拉到上百萬個。


c.Multi-Agent:多個Agent并發(fā)協(xié)作,每個獨立生成KV Cache,存儲需求隨數(shù)量成倍疊加。


模型廠商每年至少把上下文擴大一倍,HBM的物理擴容卻接近極限:單卡容量約2-3年才翻一倍,紅利還在放緩。




判斷KV Cache會不會溢出,要以單個推理機柜的可用HBM池為單位。以Rubin NVL72的21T的HBM容量為例:


部署2.8T參數(shù)的旗艦MoE模型,F(xiàn)P8下權(quán)重占約2.8 TB;再扣掉激活值、分頁與框架開銷(約占12%,約2.5 TB),真正能給KV Cache的池化空間上限約15.4 TB。


不壓縮時,10萬Token約占40 GB。即便用最前沿的壓縮算法(如谷歌TurboQuant,16位壓到3位、約5–6倍無損壓縮),100萬Token仍要占67–80 GB。


也就是說,一臺造價約500萬美元的機柜,極限只能同時服務(wù)193–230個百萬Token級長度得會話。對企業(yè)級云服務(wù)而言,這意味著極低的算力變現(xiàn)效率(ROI)。


一旦上下文擴到500萬Token,或并發(fā)突破這一閾值,機柜級HBM池會迅速觸頂。因此把KV Cache從HBM逐級卸載到DRAM再到NAND,往后看是一場必然之路。




b.便宜,也是致命吸引力


哪怕HBM容量勉強夠用,用它長期留存KV Cache在經(jīng)濟上也不成立:HBM4約16美元/GB,eSSD約0.3-0.4美元/GB,前者是后者的40-50倍。用它去放幾小時都不調(diào)一次的“溫/冷KV Cache”,是極度的資源錯配。


為此英偉達(dá)確立了新的分層內(nèi)存架構(gòu):G1 HBM→G2系統(tǒng)DRAM→G3本地SSD(NAND)→G4共享網(wǎng)絡(luò)存儲(NAND/HDD),由NVIDIA Dynamo在軟件層統(tǒng)籌,讓KV Cache在各層間透明遷移。


英偉達(dá)估計,大規(guī)模多智能體推理下每個GPU模組最高需要16 TB的KV Cache,因此在Rubin平臺構(gòu)建了ICMS/CMX上下文存儲層,位于G3本地SSD與G4共享存儲之間,定義為G3.5層——因為G3容量有限、不能跨節(jié)點共享,撐不住多智能體的大規(guī)模復(fù)用。


CMX單層容量約16TB,是單卡288GB HBM的近60倍——NAND夠便宜,才能做到量大不貴。



c.改用NAND,時延上來得及嗎?


卸載值不值得,最終看TTFT(首Token時延)——只有“從SSD讀回來”的時間和成本低于“用GPU重新算一遍”,卸載在商業(yè)上才成立。


GPU Direct Storage(GDS)是跨越門檻的關(guān)鍵:它繞過CPU和DRAM,通過PCIe/RDMA在eSSD與GPU的顯存之間修一條直連高速路。


據(jù)公開驗證,GDS結(jié)合壓縮技術(shù)可把KV Cache的恢復(fù)時延改善10倍,讓超低時延的上下文交付在工程上成為現(xiàn)實。




NAND存儲KV Cache的數(shù)據(jù)類型:“共享型記憶”和高頻復(fù)用


即使跨過容量與成本的門檻,KV Cache要卸載到NAND里,還需滿足兩個條件:


條件一:必須是共享型緩存


a.短暫型緩存(逐字生成的草稿):HBM承載


AI逐字回答(Decode階段)時,每吐一個字都要全量重讀歷史上下文。此時強行寫SSD,一是帶寬不夠、會卡死AI“說話”的節(jié)奏(速度墻),二是高頻碎片化追加寫幾周就能耗盡企業(yè)級硬盤的壽命(壽命墻)。所以這類草稿禁止落盤,必須留在HBM顯存中。


b.共享型緩存(靜態(tài)打包案卷):NAND來存


只有當(dāng)AI剛讀完超長提示詞(Prefill階段)、用戶切出對話或Agent掛起任務(wù)時,產(chǎn)生的才是算完、可整段打包寫出的完整上下文。它“塊大、順序、低頻”,像整箱搬運定稿檔案,與NAND大塊連續(xù)讀寫完美契合,這類數(shù)據(jù)才可以NAND層。



條件二:高頻復(fù)用才能“值回票價”


除了可用,經(jīng)濟也要可行:卸載凈收益=復(fù)用次數(shù)×(重算算力成本?讀回成本)?(寫入成本+占位存儲成本)


GPU重算既費電又費算力,已算好的緩存從SSD讀回,只要被復(fù)用1到2次就能盈虧平衡。挑戰(zhàn)在于硬盤空間同樣稀缺,只有高頻復(fù)用的上下文,才值這個存儲占位。


這最終濃縮為一個核心指標(biāo)——緩存命中率:命中率越高,邊際服務(wù)成本越趨近于零。新請求進(jìn)來時,系統(tǒng)通過“前綴比對”去硬盤取回備份,跳過最燒錢的Prefill重算。


正如Manus團隊指出的:命中緩存的Token比未命中的便宜約10倍。普通大模型命中率在40%–70%(MiniMax 71%、Z.ai GLM5約40%),多步執(zhí)行的Agent場景則長期企穩(wěn)在95%以上(DeepSeek實測98.7%),實現(xiàn)“寫一次、讀上千次”的紅利。


實際使用中,對話變長或GPU換用戶都會產(chǎn)生中斷,當(dāng)前KV Cache就可讓出HBM空間。如果這些會話還會被再次調(diào)用就可存到NAND中,服務(wù)恢復(fù)時再載入。


典型卸載場景包括:用戶閱讀停頓、跨周期歷史回溯、Agent掛起的長空隙、超大規(guī)模并發(fā)共享,以及企業(yè)級知識庫調(diào)用。



KV Cache分層:AI推理對存儲拉動不是單點,而是從高性能閃存(pSLC/TLC)到海量溫冷存儲(QLC),連同DRAM與HBM,把整條企業(yè)級存儲產(chǎn)品線一起拉起來。


這條通路上,各類存儲分工明確:


DRAM(G2)承接活躍任務(wù)的“熱溢出”:它是HBM的直接緩沖帶,收容同一場活躍會話中因顯存觸頂放不下的KV數(shù)據(jù)。速度快,會話不卡頓,但斷電丟失。


NAND(G3–G4)主導(dǎo)高價值資產(chǎn)的“持久復(fù)用”:跨過斷電可保留的門檻后,數(shù)據(jù)進(jìn)入非易失閃存主導(dǎo)的持久化復(fù)用鏈路,并沿介質(zhì)特性逐級下沉:


a.G3直連層(pSLC/性能型TLC):承接剛剛換出、隨時可能被重新喚醒的溫?zé)釙捝舷挛摹?/p>


b.G3.5本地網(wǎng)絡(luò)層(耐久型TLC):承接同一算力集群內(nèi),需跨節(jié)點高頻共享的System Prompt與Agent狀態(tài)。


c.G4遠(yuǎn)端歸檔層(大容量QLC/HDD):承接海量、極低頻調(diào)用的RAG企業(yè)知識庫與歷史對話歸檔。




②Staging場景:TLC與pSLC的剛性基本盤


據(jù)閃迪測算,Staging(類似候場類數(shù)據(jù),等待被HBM隨時調(diào)用)占2030年AI數(shù)據(jù)中心NAND需求的40%,是最大的單一板塊,且全部由TLC(含pSLC)包攬。


打個比方:從數(shù)據(jù)湖調(diào)出的數(shù)據(jù),先存在緊貼GPU主板的高速NVMe SSD緩沖區(qū)(G3直連SSD)。像廚師案板旁的切菜盤——食材從冷庫取出先放手邊,不必每切一刀跑一趟冷庫。


a.訓(xùn)練側(cè)Staging:突發(fā)覆蓋寫


核心任務(wù)是給模型做“定時存檔”(Checkpoint)與數(shù)據(jù)集暫存。訓(xùn)練萬億參數(shù)大模型時,單次存檔高達(dá)TB級,且每隔幾十分鐘就要滾動保存一次。


雖然現(xiàn)在能讓GPU“邊算邊存”(異步存檔)、不必停工干等,但這么大規(guī)模的集中落盤依然會嚴(yán)重擠占帶寬;存檔拖得越久,對計算流水線的干擾越大。


所以訓(xùn)練側(cè)Staging面對雙重約束:既要扛住反復(fù)覆蓋寫入的磨損,又要把寫入窗口壓到最短。


b.推理側(cè)Staging:高并發(fā)讀取


推理側(cè)Staging的三大任務(wù),共同特征是讀密集、寫極少:


模型冷啟動與彈性伸縮:訓(xùn)練機可按月連軸轉(zhuǎn),但推理機卻要隨早晚高峰頻繁調(diào)節(jié)容量和開關(guān)機,而內(nèi)存又?jǐn)嚯娂词?。所以新?jié)點上線,都要靠本地SSD的強連續(xù)讀取帶寬把參數(shù)瞬間搬進(jìn)空顯存,實現(xiàn)“秒級接客”(一天可能觸發(fā)數(shù)十次重載)。


多模型/多版本動態(tài)常駐:生產(chǎn)節(jié)點常需同時伺候幾十TB的“全家桶”(不同尺寸、精度、版本)。單卡顯存(288GB)和系統(tǒng)內(nèi)存與之差一到兩個數(shù)量級,唯有4–16TB直連SSD裝得下整套工具箱。讓極少調(diào)用的舊模型霸占昂貴顯存是錯配,下沉至SSD換入換出才是最優(yōu)解。



面對這種極端的I/O強度,各類介質(zhì)逐一被淘汰:


HBM&DRAM:成本極高且容量稀缺,必須留給活躍的KV Cache;更致命的是DRAM斷電即失,而Checkpoint的意義恰恰是“系統(tǒng)崩潰后還能恢復(fù)”。


HDD:吞吐量跟不上GPU突發(fā)的大塊寫入,且受體積與功耗限制,根本進(jìn)不了GPU計算托盤所在的機柜。


QLC:擦寫壽命約為TLC的十分之一(QLC約1,000次,TLC約10,000次)。Staging是AI存儲棧中寫入最重的環(huán)節(jié),QLC壽命會迅速耗盡——這是硬約束,而非成本權(quán)衡。


這樣,TLC正好適合Staging,但TLC在部分場景下還不夠,由此衍生出pSLC:


pSLC,是把TLC或QLC顆粒當(dāng)SLC用——本可存3 bit或4 bit的Cell只存1 bit。換來更長的耐久度和更低的寫入延遲,代價是犧牲約三分之二有效容量。


直接后果是:要達(dá)到與標(biāo)準(zhǔn)SSD相同的有效容量,需要3-4倍晶圓產(chǎn)出。核心觸發(fā)場景是RAG與Agentic Search的高頻向量檢索。


AI智能體做大規(guī)模向量檢索新特征(如下),逼著NAND必須以高速pSLC模式運行:


a.找得太碎(訪問粒度極細(xì)):AI搜索知識庫時往往只需比對一小串特征(幾百字節(jié))。但標(biāo)準(zhǔn)TLC SSD是個“死腦筋”,哪怕只要一個字,也得把整頁(4KB)全讀出來,浪費讀取帶寬。


b.問得太密(并發(fā)強度極高):現(xiàn)在的AI會自己做計劃、調(diào)工具、反復(fù)查資料,單次任務(wù)瞬間裂變成成千上萬個密集的“查字典”請求。標(biāo)準(zhǔn)TLC SSD在高并發(fā)下迅速排隊飽和。


c.邊讀邊寫(讀寫雙向承壓):AI智能體會一邊查一邊更新索引、記錄中間狀態(tài)。這種“一邊翻書一邊做筆記”的強度會讓普通TLC壽命快速耗盡,而pSLC壽命是它的十幾倍。




但承載這一層的下一代直連架構(gòu)——NVIDIA Storage-Next(G2.6層,位于G2.5 CXL內(nèi)存之下、G3本地SSD之上)——仍處在英偉達(dá)主導(dǎo)、與鎧俠等廠商協(xié)同定義規(guī)格的階段。


它的定位,是在DDR與本地SSD之間新增一層直連GPU的pSLC存儲層,讓NAND具備接近DRAM的IOPS與訪問粒度(512B細(xì)粒度隨機訪問),同時保留低成本、大容量優(yōu)勢。





③Fast Data Lake場景:QLC的主戰(zhàn)場


如果說GPU直連SSD是案板旁的“切菜盤”,存儲需要讀寫雙能。G4遠(yuǎn)端網(wǎng)絡(luò)層的Fast Data Lake(快速數(shù)據(jù)湖)就是AI數(shù)據(jù)中心的“遠(yuǎn)端中央總倉”,以讀為主:以PB級容量裝下AI運轉(zhuǎn)所需的全部“家底”——訓(xùn)練語料、多模態(tài)數(shù)據(jù)集、各版本模型權(quán)重、RAG知識庫和推理回流日志。


按閃迪2030年的需求拆分,F(xiàn)ast Data Lake約占AI數(shù)據(jù)中心NAND需求的25%,幾乎全部由QLC承載。


核心問題是:QLC能否替代HDD?海豚君認(rèn)為需從以下維度分析:


a.熱數(shù)據(jù)——QLC穩(wěn)坐主位


正在被CPU/GPU高頻消費的數(shù)據(jù)(如正在處理的訓(xùn)練集、等待檢索的RAG知識庫),需要極高的數(shù)據(jù)吞吐量。


HDD的機械磁頭尋道延遲(毫秒級)與AI所需的微秒級響應(yīng)差了兩個數(shù)量級,從一開始就被物理排除。QLC憑借超大容量和讀寫帶寬,在此層是替代的絕對主力。


b.溫冷數(shù)據(jù):HDD坐主桌


對于“存著備查”和“歷史歸檔”類數(shù)據(jù),是否放入QLC取決于兩個維度:


①供給側(cè)擾動:短期“假性替代”


短期HDD將出現(xiàn)300EB至400EB的供給缺口。當(dāng)前部分云廠商用eSSD臨時兜底,造成了“加速替代”的假象。


但HDD也能用類似SSD的技術(shù)持續(xù)拉升產(chǎn)能,被eSSD臨時接管的純?nèi)萘啃枨蠡亓鱄DD,替代邏輯變?nèi)酢?/p>


②經(jīng)濟賬:QLC漲價后算不平


短期因缺貨有替代跡象,但后續(xù)QLC因熱數(shù)據(jù)層的替代是剛需,導(dǎo)致QLC漲價。當(dāng)下HDD的每GB價差已飆升至20–25倍。在穩(wěn)冷層數(shù)據(jù)存儲中,QLC反而難取代HDD。后續(xù)要QLC出現(xiàn)大容量低成本的產(chǎn)品面世后,替代概率才可能加大。


因此QLC替代HDD絕非單向線性推進(jìn),而是分化為三種敘事:


a.性能關(guān)鍵路徑(熱數(shù)據(jù))上,替代已經(jīng)完成且不可逆;


b.溫冷歸檔層,高昂價差阻斷了正常置換,目前的“替代份額”更多是HDD缺貨逼出的“臨時補位”,未來面臨回流風(fēng)險;


c.長期勝負(fù)手在于大容量高密度QLC量產(chǎn),能否靠極致“空間與能耗壓縮”,在TCO上跨過2-3倍的替換紅線。


據(jù)閃迪業(yè)績會,超大容量QLC在FQ4'26(2026年4-6月)剛產(chǎn)生首批收入,F(xiàn)Q1'27進(jìn)入早期爬坡。閃迪預(yù)計QLC占整體bit出貨的比例,從2025年約20%升至2026財年末的40%,主要由Stargate(超大容量QLC)在云廠商放量驅(qū)動。



④HBF:需求上行期權(quán)


在傳統(tǒng)AI存儲層級中,緊貼GPU的HBM雖有百納秒級延遲與超高帶寬,但受DRAM制程限制,單堆棧容量小、成本高;再往下到NVMe SSD,延遲與帶寬又出現(xiàn)嚴(yán)重斷層。


NAND廠商現(xiàn)在在努力推新品:HBF(High Bandwidth Flash)——它的結(jié)構(gòu)基本是HBM的復(fù)刻:多層堆疊、TSV貫通連接上下、與XPU共同封裝,只是把DRAM顆粒換成了NAND顆粒


閃迪正開發(fā)的HBF,號稱堆疊16層NAND、在維持HBM級帶寬的同時把容量放大8倍。(參考:從HBM限高到NAND加量,英偉達(dá)vs存力到底誰拿捏誰?)。



HBF與HBM并非簡單替代關(guān)系,而是基于物理特性的優(yōu)劣互補:


HBF優(yōu)勢是容量大,成本低,但短板同樣明確:微秒級延遲讓它反應(yīng)偏慢,不擅長細(xì)碎的隨機散讀;且有物理擦寫壽命上限,只能當(dāng)“只讀參考書”,扛不住高頻寫入。


此外HBF仍在工程推進(jìn)期:2026年下半年進(jìn)入試產(chǎn)建線、預(yù)計2027年商業(yè)化,但緊貼高發(fā)熱GPU部署的散熱標(biāo)準(zhǔn)仍待確立。



由此形成分工:


HBM專注“性能至上”,是旗艦GPU的絕對標(biāo)配,負(fù)責(zé)對延遲極敏感的預(yù)填充(Prefill)階段、高頻讀寫的活躍KV Cache,以及要求最高對稱讀寫帶寬的訓(xùn)練任務(wù)。


HBF主打“容量為王”,接管以順序讀取為主的常規(guī)推理、需單機容納全量模型的長文本與MoE場景,以及讀多寫少的溫冷KV Cache卸載,讓中低端GPU甚至未來的邊緣設(shè)備也能跑超大模型。



因此海豚君認(rèn)為,HBF不是顛覆HBM,二者共存互補——HBM管延遲敏感的熱數(shù)據(jù),HBF管容量饑餓的溫數(shù)據(jù)。未來HBF的使用滲透還要繼續(xù)觀察。


閃迪將HBF分成四種部署形態(tài),具體定義可見《AI推理大爆發(fā),“悲催”閃迪真有鳳凰涅槃?》。海豚君認(rèn)為,③增配型(HBF+HBM混搭)和④解耦型(池化)落地可能性最大。


增配型的邏輯最簡單:HBM不撤,HBF加進(jìn)來一起用。GPU廠商不用大改,HBM繼續(xù)干擅長的活,HBF在旁邊裝權(quán)重和冷KV緩存。SK海力士新提的H3架構(gòu)就是HBM和HBF混搭——2027年量產(chǎn)、2028年客戶上車,是目前阻力最小的路。


解耦型則是把HBF從GPU旁獨立出來,像硬盤柜一樣池化部署、通過網(wǎng)絡(luò)連接計算單元。這是未來大方向——NVIDIA的CMX方案推的也是類似的機架級存儲池;但它要求網(wǎng)絡(luò)架構(gòu)跟著升級,預(yù)計2028年之后才可能成為實際選項。




從各廠商路線來看,HBF目前仍處于標(biāo)準(zhǔn)聯(lián)盟階段,尚未進(jìn)入GPU廠商(特別是NVIDIA)的官方架構(gòu)標(biāo)準(zhǔn)中。


閃迪與SK海力士是當(dāng)前唯二的實質(zhì)推動者:雙方已于2026年初成立標(biāo)準(zhǔn)聯(lián)盟并建起試產(chǎn)線,比原計劃提前半年——預(yù)計2026年底造出芯片,明年推控制器,2027年沖刺量產(chǎn)。


谷歌、英偉達(dá)、AMD等最早要到2028年才可能作為客戶采用,但采用≠定義——HBF真正進(jìn)入GPU廠商的架構(gòu)體系,還要過標(biāo)準(zhǔn)認(rèn)證、參考設(shè)計集成、生態(tài)適配等關(guān)卡。


其他廠商:三星有專利儲備,但未公開原型與時間表;鎧俠走XL-FLASH路線(G2.6 Storage Next),與HBF不直接競爭;美光暫無公開計劃。


總體看,HBF產(chǎn)業(yè)化時間線雖在加速,但格局本質(zhì)是“存儲廠商在推動,GPU廠商尚未上車”。真正的分化要等2027年樣品表現(xiàn),以及2028年頭部客戶是否正式將其納入系統(tǒng)設(shè)計。



總結(jié):


AI對NAND的重塑,不只是把需求曲線抬高一個臺階,確實有希望打破“硅周期”宿命:“算力部署與推理負(fù)載主導(dǎo)”下,NAND也從“外圍零部件”變成“計算路徑上的必需品”。


在“由訓(xùn)轉(zhuǎn)推”與長上下文時代,用NAND存KV Cache是保存昂貴的GPU算力與電費資源,SSD一定程度上就是“Token電池”。


據(jù)閃迪測算,2030年AI數(shù)據(jù)中心NAND出貨量將達(dá)1.2 ZB(較2026年增長約三倍),三大核心負(fù)載分工明確:


a.Staging暫存層(占比40%):貼近GPU的極高強度I/O緩沖區(qū),受極端覆蓋磨損與高并發(fā)限制,由高性能TLC(及pSLC)壟斷。


b.KV Cache卸載層(占比35%):推理時代全新增量,承載HBM溢出的動態(tài)存儲容量,由TLC/QLC梯次承接。


c.Fast Data Lake快速數(shù)據(jù)湖(占比25%):遠(yuǎn)端中央數(shù)據(jù)總倉,由大容量QLC穩(wěn)坐主位。


按NAND類型計,TLC占66%、QLC占34%:占比最大的Staging因?qū)懭霃姸龋烊慌懦釷LC,TLC穩(wěn)占基本盤;QLC聚焦數(shù)據(jù)湖與溫冷KV Cache卸載。


這三類負(fù)載的演進(jìn)方向恰好相反:數(shù)據(jù)湖向“更便宜”走(QLC容量放大),Staging與熱路徑則向“更快更耐用”走(TLC乃至pSLC,犧牲約三分之二容量換取10倍耐久性)。


而這波漲價的“超級行情”還能飛多久?站在當(dāng)前估值節(jié)點,涅槃后的閃迪是否仍有向上空間?海豚君將繼續(xù)在下篇為您拆解,敬請期待!

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
新乐市| 安泽县| 英德市| 南丰县| 五华县| 商南县| 惠州市| 靖远县| 镇平县| 庄河市| 云龙县| 丽江市| 东明县| 石楼县| 衡阳县| 镇巴县| 鹿邑县| 闻喜县| 杭州市| 石阡县| 奉化市| 来宾市| 辛集市| 喀喇沁旗| 双江| 绍兴县| 通山县| 弥勒县| 乐业县| 马龙县| 梧州市| 政和县| 广东省| 丁青县| 洛南县| 南江县| 哈巴河县| 手游| 松滋市| 库尔勒市| 锦屏县|