久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**AI內(nèi)存擴(kuò)容面臨工藝與產(chǎn)能瓶頸:HBM堆疊層數(shù)可能不增反減,英偉達(dá)下一代Rubin Ultra考慮從16層降至8層;帶寬提升卡在封裝環(huán)節(jié),混合架構(gòu)(HBM+HBF)將成為主流選擇,內(nèi)存廠與代工廠的議價(jià)權(quán)將重新分配。** **要點(diǎn)** **1. HBM層數(shù)可能不增反減** DRAM晶圓產(chǎn)能有限,堆高工藝成本高且良率低。英偉達(dá)Rubin Ultra考慮從16層降至8層,通過(guò)增加顆數(shù)(576顆GPU互聯(lián))使系統(tǒng)總?cè)萘窟_(dá)110TB,是B300機(jī)柜的5倍,但壓力轉(zhuǎn)向CoWoS封裝產(chǎn)能和互聯(lián)技術(shù)。 **2. 容量擴(kuò)容有兩條對(duì)立路徑** 一是繼續(xù)堆高(16–20層),代價(jià)是工藝復(fù)雜、顆粒削薄易翹曲;二是多顆少層或改用HBF(高帶寬閃存),犧牲帶寬但成本更低。最終大概率走向混合分層架構(gòu):HBM放高頻數(shù)據(jù),HBF/DDR放低頻數(shù)據(jù)。 **3. 帶寬提升瓶頸在外部封裝而非內(nèi)存內(nèi)部** 位寬與速率在線寬上相互競(jìng)爭(zhēng),繼續(xù)提速需依賴先進(jìn)中介層(CoWoS-L)和3D封裝,卡點(diǎn)在臺(tái)積電等代工廠。Base Die和中介層設(shè)計(jì)成為關(guān)鍵,內(nèi)存廠自研封裝能力(三星)可能獲得優(yōu)勢(shì)。 **4. HBF是廉價(jià)大容量替代方案** HBF單堆容量可達(dá)512GB(16層HBM4僅48GB),單位成本僅HBM的1/5~1/10,但因延遲高、寫(xiě)入慢,只適合存儲(chǔ)模型參數(shù)等低頻訪問(wèn)數(shù)據(jù),無(wú)法取代HBM。 **5. 不同情境決定產(chǎn)業(yè)鏈誰(shuí)受益** 若模型參數(shù)增長(zhǎng)放緩,容量需求為主,存儲(chǔ)回歸走量邏輯,NAND廠商受益;若帶寬更關(guān)鍵,封裝代工環(huán)節(jié)拿走稀缺溢價(jià),內(nèi)存廠議價(jià)權(quán)被稀釋;若兩者同時(shí)告急,內(nèi)存廠自身工藝和產(chǎn)能成為最硬卡點(diǎn),價(jià)值最高。
從HBM 限高到NAND 加量,英偉達(dá)vs 存力到底誰(shuí)拿捏誰(shuí)?
2026-09-29 19:08

從HBM 限高到NAND 加量,英偉達(dá)vs 存力到底誰(shuí)拿捏誰(shuí)?

本文來(lái)自微信公眾號(hào): 海豚研究 ,作者:海豚君,原文標(biāo)題:《從 HBM 限高到 NAND 加量,英偉達(dá) vs 存力到底誰(shuí)拿捏誰(shuí)?》


在上篇文章中存力接棒算力,HBM為什么“脫穎而出”?,海豚君從底層技術(shù)出發(fā),回答了AI對(duì)存力的需求為何"突然"爆發(fā),以及HBM憑什么成為高性能GPU的首選內(nèi)存,并介紹了HBM內(nèi)存技術(shù)的核心概念與邏輯。那么隨著AI技術(shù)的發(fā)展,內(nèi)存技術(shù)又將如何演變,以實(shí)現(xiàn)更大的容量和更快的帶寬?


恰巧,近期業(yè)內(nèi)也出現(xiàn)了兩個(gè)看似矛盾的信號(hào):一邊是HBM路線圖繼續(xù)加碼,堆疊層數(shù)從12層走向16層、20層;另一邊據(jù)SemiAnalysis,英偉達(dá)下一代Rubin Ultra的HBM可能從16層一路砍到8層,同時(shí)以閃存顆粒為基礎(chǔ)的HBF,也在試圖從HBM手中分走一部分容量需求。


HBM是否會(huì)被取代,還是會(huì)更加稀缺?HBM究竟該不該繼續(xù)堆高?本篇我們就沿著上篇結(jié)尾留下的容量、帶寬和成本三條線索,主要討論以下幾個(gè)問(wèn)題:


1)要繼續(xù)擴(kuò)大內(nèi)存容量,行業(yè)有哪幾條路可走?各自的代價(jià)是什么?為什么HBM的層數(shù)反而可能不增反減?


2)為什么帶寬比容量更難提升?瓶頸卡在哪里,后續(xù)又有哪些突破口?


3)不同的場(chǎng)景下,哪條技術(shù)路線更可能被選擇?對(duì)產(chǎn)業(yè)鏈以及內(nèi)存廠商的話語(yǔ)權(quán)會(huì)有何影響?


以下是正文


一、擴(kuò)大容量,有哪些途徑?


先從如何繼續(xù)加大內(nèi)存容量的問(wèn)題出發(fā),目前業(yè)內(nèi)有兩個(gè)并行的方向:一是突破工藝上限,把單顆內(nèi)存做得更強(qiáng),代價(jià)是更復(fù)雜的工藝、更高的成本和可能更低的良率;二是更側(cè)重性價(jià)比,不追求單顆性能,轉(zhuǎn)而以數(shù)量取勝,用不同規(guī)格的產(chǎn)品匹配不同層級(jí)的需求。


1.1、路徑一:更強(qiáng)的單顆性能


a.繼續(xù)堆更多層


最直接的方法是沿著現(xiàn)有路徑繼續(xù)增加堆疊層數(shù):HBM3E為12層,部分HBM4/4E將做到16層,HBM5路線圖則指向20層。


但加層并沒(méi)有說(shuō)起來(lái)那么簡(jiǎn)單。HBM與XPU共同封裝、共用底座和頂蓋,因此內(nèi)存堆的總高度是受限的:HBM3E及之前的規(guī)范上限為720um,HBM4放寬到775um。



限高之下要塞進(jìn)更多層,只能:①把單層DRAM顆粒削??;②壓縮層間空隙,把微凸點(diǎn)(micro-bump)做小,甚至去掉微凸點(diǎn),讓上下兩層的銅觸點(diǎn)直接做銅銅鍵合(Cu-Cu Bonding)。


但更精密的工藝意味著更高的成本和更低的良率:①削薄后的硅片強(qiáng)度下降,更易翹曲或在堆疊中損壞;②層間空隙縮小,散熱和絕緣填充都更難,熱壓工藝(TC-NCF)已難以勝任,需轉(zhuǎn)向海力士的回流焊(MR-MUF)或混合鍵合;③層數(shù)越多,對(duì)供電、傳輸和散熱的要求越高,TSV需要做得更密、孔徑更窄。


簡(jiǎn)單來(lái)說(shuō),這條路徑是用更難的工藝和更高的成本換單顆容量,對(duì)內(nèi)存廠的要求更高,好處是新增的容量都能享受首排內(nèi)存的高帶寬。


b.繞過(guò)限高的偷懶方法


另一個(gè)“走捷徑”的辦法是變相加高堆疊高度:如下圖,把GPU下方的中介層墊高,在兩者頂部仍然齊平的前提下,讓內(nèi)存堆可用的高度提升到約800um。


這樣可以少削薄甚至不削薄顆粒就多塞幾層,省下復(fù)雜工藝帶來(lái)的成本和良率損失。但能擠出的空間有限:從720um到800um,按每層寬度只比45um略有減少,最多只能再多放2層。



1.2、路徑二:多放存儲(chǔ),以量取勝


a.多排內(nèi)存:前排保速度,后排給容量


另一條路是增加內(nèi)存的數(shù)量。由于緊貼XPU的位置有限,新增的內(nèi)存大概率只能放在后排:這省去了加密堆疊的工藝難題,代價(jià)是后排內(nèi)存的帶寬勢(shì)必更低。


這里后排用什么內(nèi)存、怎么封裝都有選擇:①規(guī)格上,除了下圖中的HBM,也可以用普通DDR,乃至基于NAND的HBF(后文展開(kāi)),單位容量成本更低;


②封裝上,后排既可以和XPU一起放在硅中介層上(速度快,但貴且中介層面積有限),也可以放到次一級(jí)的基板甚至PCB上(速度慢,但便宜、空間充裕)。


③但后排不能無(wú)限加,帶寬是最大的瓶頸:因后排內(nèi)存的數(shù)據(jù)需前排內(nèi)存中轉(zhuǎn),整個(gè)多排內(nèi)存的最大帶寬,受限于首排HBM和XPU間的帶寬。如下圖的示例,若首排HBM與XPU之間的帶寬為4TB/s,在扣除自身需要和XPU通訊占用的2TB/s帶寬后,能用于替后排內(nèi)存中轉(zhuǎn)傳輸?shù)膸捑椭荒苡?TB/s,若再加第三排內(nèi)存就依次減少。



b.HBF:更便宜的選擇?


前文已提到,為了降低單位存儲(chǔ)的價(jià)格,行業(yè)有考慮用其他規(guī)格存儲(chǔ)來(lái)代替HBM,其中一個(gè)重要選項(xiàng)是HBF—即高帶寬閃存(High Bandwidth Flash)。正如其名,它的結(jié)構(gòu)基本是HBM的復(fù)刻:多層堆疊、TSV貫通連接上下、與XPU共同封裝,只是把DRAM顆粒換成了NAND顆粒。


值得一提的是,NAND本身就是3D結(jié)構(gòu),為什么HBF還要像HBM一樣多片堆疊?


原因在于,NAND的“3D”是存儲(chǔ)單元層的堆疊,只加容量、不加讀出通道:同一串單元共用一套讀出電路,每次只能讀其中一層。


HBF的額外帶寬來(lái)自并行:?jiǎn)纹琩ie內(nèi)部劃分成大量小陣列同時(shí)讀出(下圖右),再用TSV把16片die堆疊起來(lái)同時(shí)輸出。普通NAND 3D架構(gòu)雖然也疊容量,卻掛在同一條總線上輪流傳輸(具體情況請(qǐng)見(jiàn)海豚君對(duì)NAND的研究)。



與HBM相比,HBF的優(yōu)劣勢(shì)都很鮮明:


①優(yōu)勢(shì)--容量大、便宜、省電:計(jì)劃于2026年末至27年初推出的HBF Gen1(16層堆疊),單堆容量可達(dá)512GB,而16層HBM4只有48GB;HBF單GB價(jià)格據(jù)調(diào)研可能只有HBM的1/5~1/10左右。且NAND顆粒天生功耗和散熱需求相對(duì)更低。


②帶寬做到同一量級(jí):憑借類似的堆疊和共同封裝工藝,據(jù)公司披露HBF Gen1讀取帶寬可達(dá)1.6TB/s(寫(xiě)入慢很多),約為HBM4規(guī)范最高帶寬的55%。


③但NAND天生延遲高、寫(xiě)入慢、按塊讀取、擦寫(xiě)壽命有限,注定無(wú)法取代HBM:其讀取延遲約1~10us,DRAM僅約0.1us,寫(xiě)入還要再慢10~100倍;按塊讀取則意味著每次都會(huì)夾帶不需要的數(shù)據(jù),實(shí)際有效帶寬要打折扣。


因此HBF只適合不需要頻繁讀寫(xiě)的數(shù)據(jù),如全量模型參數(shù)(非激活)、壓縮后的上下文緩存、暫未調(diào)用的MoE專家參數(shù)等。



c.混合架構(gòu),最可能的結(jié)局?


以上討論的各種方法,在傳輸速度、容量、成本這三者上都無(wú)法兼?zhèn)?,因而目前業(yè)內(nèi)展望的一個(gè)最可能的遠(yuǎn)期解是,采取多級(jí)、混合的存儲(chǔ)架構(gòu)。例如在XPU芯片的一側(cè)共同封裝HBM提供高傳輸速度,負(fù)責(zé)需高頻讀寫(xiě)的數(shù)據(jù),另一側(cè)封裝HBF提供更大的容量,負(fù)責(zé)相對(duì)更低頻的數(shù)據(jù)。


更遠(yuǎn)期的HBM7設(shè)想中,還會(huì)再加一層走PCIe協(xié)議的池化存儲(chǔ),讓每顆XPU都能共享調(diào)用整個(gè)系統(tǒng)的DRAM、SSD和HBF。各級(jí)存儲(chǔ)各司其職:HBM放最常用的參數(shù)和KV緩存,DDR和HBF次之,SSD等池化存儲(chǔ)存放不太被調(diào)用的“冷”數(shù)據(jù)。




1.3、HBM層數(shù)會(huì)不增反減?


近期另一個(gè)熱議的市場(chǎng)觀點(diǎn):HBM的層數(shù)可能不增反減。起因是英偉達(dá)下一代Rubin Ultra:每個(gè)計(jì)算核心配4顆HBM,最初規(guī)格為16層,后據(jù)供應(yīng)鏈反饋降為12層,最近又傳出可能改為8層。


每顆GPU的HBM總?cè)萘恳搽S之從768GB砍半再砍半至192GB。需要注意,以上變動(dòng)均未經(jīng)英偉達(dá)官方確認(rèn),只代表其在考慮不同選項(xiàng)。



XPU廠商可能“降級(jí)”用更少層數(shù)的HBM,除了堆高本身工藝難、成本高,還有三個(gè)原因:


①DRAM晶圓產(chǎn)能有限:目前要產(chǎn)出同等GB容量,HBM消耗的DRAM晶圓本已是常規(guī)DRAM的3~4倍。


而若堆疊層數(shù)繼續(xù)加高,對(duì)DRAM晶圓損耗會(huì)更大。這樣同樣產(chǎn)線數(shù)量(產(chǎn)能)下,能產(chǎn)出的存儲(chǔ)總?cè)萘糠炊鴷?huì)變少。而DRAM新增產(chǎn)能需要時(shí)間,據(jù)下圖投行預(yù)測(cè),24~26年晶圓產(chǎn)能增長(zhǎng)有限,27年才會(huì)有較多釋放。


因此DRAM圓晶產(chǎn)能有限,應(yīng)當(dāng)是HBM層數(shù)短期內(nèi)或許無(wú)法繼續(xù)堆高的主要卡點(diǎn)。



②互聯(lián)規(guī)模擴(kuò)大,系統(tǒng)總?cè)萘坎唤捣瓷杭幢銌晤wGPU的內(nèi)存變少,Scale-up技術(shù)讓單個(gè)機(jī)柜內(nèi)互聯(lián)的GPU數(shù)量大幅增加,系統(tǒng)總?cè)萘糠炊笤觥?/p>


如下圖,B300單顆GPU配8顆12層HBM3E、共288GB,一個(gè)機(jī)柜最多互聯(lián)72顆,總?cè)萘考s20TB;而Rubin Ultra單顆GPU即便只配8顆8層HBM、共192GB,最多可互聯(lián)576顆,系統(tǒng)共享的總?cè)萘窟_(dá)110TB。單顆容量少了1/3,系統(tǒng)總?cè)萘繀s是前者的5倍上下。



可見(jiàn),降層數(shù)本質(zhì)上也是在產(chǎn)能有限的情況下,壓降工藝難度和成本,以數(shù)量取勝。它有合理性,但也帶來(lái)兩個(gè)新問(wèn)題:


①瓶頸轉(zhuǎn)向Base Die和共同封裝產(chǎn)能:用更多顆低層數(shù)HBM,省下了DRAM晶圓,卻要消耗共同封裝產(chǎn)能。關(guān)鍵從內(nèi)存廠自身的擴(kuò)產(chǎn)速度,變成了能從臺(tái)積電(以及三星、Intel)鎖定多少產(chǎn)能。


②拉高對(duì)互聯(lián)的要求:堆疊層數(shù)由高降低低,更大占地面積要求更多共封產(chǎn)能,節(jié)省的產(chǎn)量轉(zhuǎn)化為DRAM產(chǎn)品,但市場(chǎng)對(duì)存儲(chǔ)的需求是不斷增加的。這對(duì)內(nèi)存池化要求自然會(huì)拉高。


壓力就傳到了提高內(nèi)存利用率的連接技術(shù)上:


a.超量GPU互聯(lián)下的HBM存儲(chǔ)共享:Rubin Ultra就是在降低了HBM層數(shù)的情況下,從原本的72個(gè)GPU互聯(lián),拉高到柜內(nèi)144個(gè)、跨柜576個(gè)GPU Scale-up,這樣這個(gè)群組內(nèi),每個(gè)GPU上配的HBM也在同一地址上互聯(lián),從而實(shí)現(xiàn)更大的共享HBM存儲(chǔ)池,用來(lái)承載圍繞GPU運(yùn)算和存模型參數(shù)的存儲(chǔ)需求。


b.DRAM內(nèi)存池化:是用CXL交換芯片做普通DRAM的內(nèi)存池化,用這種交換芯片把一個(gè)個(gè)DRAM芯片組成一個(gè)大的內(nèi)存池(類似用NVLINK把多個(gè)GPU連在一起),主要用來(lái)承載長(zhǎng)對(duì)話和Agent模式所產(chǎn)生大量上下文數(shù)據(jù)。


此外,英偉達(dá)還通過(guò)CMX產(chǎn)品,也做一個(gè)NAND池化平臺(tái),來(lái)承載上下文記憶中使用頻率不如DRAM的那部分。


二、封裝與帶寬,另兩個(gè)關(guān)鍵要素


從層數(shù)之爭(zhēng)可以看到兩個(gè)關(guān)鍵變量:①帶寬能否繼續(xù)顯著提升,只有帶寬跟得上,堆高層數(shù)才有價(jià)值;②共同封裝和Base Die產(chǎn)能是否充足,只有產(chǎn)能跟得上,降層數(shù)、多顆數(shù)的路才走得通。這就引出本部分的討論:封裝與帶寬。


2.1、CoWoS封裝


上篇已提到,HBM的高帶寬離不開(kāi)與XPU共同封裝在硅中介層上。這一環(huán)節(jié)目前主要依賴臺(tái)積電的CoWoS工藝(Chip-on-Wafer-on-Substrate),該技術(shù)顧名思義分為三層:最頂層的芯片(Chip),中層的中介層(Wafer),和最底層的基板(Substrate)。


其主要作用類似一個(gè)沙漏,把納米級(jí)精度的芯片線路逐層放大,最終接到毫米級(jí)精度的主板上。(下圖可見(jiàn),芯片和中介層間由微凸點(diǎn)連接,中介層和基板之間是C4凸點(diǎn),基板和PCB板之間是BGA焊球,每層連接精度逐步變低)




CoWoS有S、R、L三個(gè)變種,差別在中介層:S(Silicon)是整塊硅中介層;R(RDL)用類似PCB的銅線加絕緣層復(fù)合結(jié)構(gòu);L(LSI,局部硅互聯(lián))則是兩者的結(jié)合。


①CoWoS-S的問(wèn)題除了貴,更在于面積受限:硅中介層全部用硅基裸芯,光刻單次曝光的最大面積約858mm2,更大就要多次拼接,拼得越多良率越低,目前最大只能做到單次曝光面積的約3.3倍。


②CoWoS-R即中介層的材質(zhì)由硅片換為RDL,后者制作方式和PCB類似,由銅、絕緣層、塑封等堆疊而成。無(wú)需半導(dǎo)體工藝制造,因而成本更低、面積可以更大,但支持的線路精度也低,不適用于HBM場(chǎng)景,就不過(guò)多討論。


③CoWoS-L則以RDL為主體,只在HBM與XPU連接處等需要高精度的位置嵌入小塊硅橋。依靠該技術(shù),單片中介層的面積已能做到單次曝光的5.5倍,英偉達(dá)從B200系列起就已采用。


④Intel和三星等公司也都有類似的共同封裝工藝,其中Intel的EMIB工藝更加簡(jiǎn)單,去掉了中介層只有基板層。對(duì)需要高精度連接的部分,直接在基板內(nèi)嵌入硅片層。不過(guò)目前EMIB技術(shù)基本僅用于Intel內(nèi)部產(chǎn)品,外部客戶如TPU和Trainium芯片,據(jù)報(bào)道仍在接觸并測(cè)試該技術(shù)。


⑤從投行們統(tǒng)計(jì)預(yù)測(cè)的CoWoS產(chǎn)能數(shù)據(jù),我們能看到:CoWoS-L確實(shí)已是主流方案,使用占比在60%以上。且相比DRAM晶圓的產(chǎn)能直到27年才會(huì)有一定釋放(增長(zhǎng)15%~20%),CoWoS的產(chǎn)能增長(zhǎng)確實(shí)更快,27年就相比26年翻倍。


因此,選擇用更多數(shù)量的低堆疊層數(shù)的HBM,而非數(shù)量更少但層數(shù)更高的HBM,從產(chǎn)能角度有其合理性。


⑥小結(jié)來(lái)看,CoWoS-L和EMIB工藝,都幫助降低封裝的成本,并增加了芯片的最大封裝面積,讓單顆GPU芯片內(nèi)能裝配更多數(shù)量的內(nèi)存,也是前文提到的GPU內(nèi)封裝多排內(nèi)存的技術(shù)前提。




2.2、位寬和速率無(wú)法兼得?帶寬還能如何提升?


單個(gè)內(nèi)存的帶寬=位寬(并行的道路條數(shù))×速率(每條路上數(shù)據(jù)跑的速度)。一顆GPU的整體內(nèi)存帶寬=單個(gè)內(nèi)存帶寬×內(nèi)存?zhèn)€數(shù)??吭黾觾?nèi)存?zhèn)€數(shù)來(lái)提升系統(tǒng)總帶寬很簡(jiǎn)單直白,最大的限制就是XPU四周有沒(méi)有足夠的空間安裝更多數(shù)量的HBM。因此我們把重點(diǎn)縮窄到如何提升單個(gè)內(nèi)存的帶寬上。


而單個(gè)內(nèi)存帶寬的高低,取決于內(nèi)部帶寬和外部帶寬兩個(gè)部分。內(nèi)部帶寬,是數(shù)據(jù)經(jīng)內(nèi)存塊(Bank)匯總到其所在的內(nèi)存層(Layer),再經(jīng)TSV把整個(gè)堆棧(Stack)的信息匯總到基底層(Base Die),這一串流程的速度;外部帶寬則是指Base Die把數(shù)據(jù)經(jīng)中介層送到XPU的速度。


因此,內(nèi)存帶寬想要提升,需內(nèi)部和外部共同提速。


這里直接給個(gè)結(jié)論,目前瓶頸和難度更多在外部帶寬,難點(diǎn)更多在基底層和中介層的設(shè)計(jì)和制造。內(nèi)部傳輸,畢竟傳輸?shù)木嚯x更短,且可以靠加密TSV通路的數(shù)量來(lái)提升。技術(shù)可行且實(shí)現(xiàn)路徑比較清晰。


這里再給一個(gè)結(jié)論,位寬和速率看似是攜手幫助提升帶寬的“合作伙伴”,但實(shí)際兩者更像是相互制約、相互競(jìng)爭(zhēng)資源的“對(duì)手”。


從歷代HBM看:HBM1到HBM3E,位寬一直是1024位,帶寬提升幾乎全靠速率(增長(zhǎng)了8~10倍),但速率的提升也在放緩,從每代翻倍降到每代提升1/4~1/2;而到了位寬翻倍的HBM4,一開(kāi)始標(biāo)準(zhǔn)速率是原地踏步都為8TB/s,后續(xù)才有所提升,可見(jiàn)兩者不易同時(shí)提升。



那么制約位寬、速率提升各自的決定因素有哪些?為何位寬和速率是相互競(jìng)爭(zhēng)關(guān)系?后續(xù)帶寬還能不能繼續(xù)大幅提升?這里涉及較多晦澀的術(shù)語(yǔ),海豚君會(huì)嘗試以更通俗易懂的類比方式來(lái)解釋。


①位寬比較容易理解,即內(nèi)存和XPU間的通訊線路數(shù)量,其決定公式大致是:位寬=線路占用的總面積/(線寬+線間距)。因此要提高位寬,要么需要線路的寬度和間距更窄(對(duì)應(yīng)更高精度的刻蝕工藝);要么就需要在中介層上有更多的面積用于刻蝕通訊線路,同時(shí)HBM Base Die和XPU內(nèi)的PHY面積也需要增大。


②速率是指單條線路每秒能傳多少比特?cái)?shù)據(jù),好比水管里的水流速度:源頭水壓越大、水管越短越粗,水流越快。


對(duì)應(yīng)到芯片,一是類似于水龍頭的Base Die,需要以更高的頻率和電壓來(lái)發(fā)送信號(hào),功耗和散熱壓力隨之上升。這也是Base Die要交給臺(tái)積電等以先進(jìn)工藝代工的原因之一;


二是線路要短、要粗,線與線之間還要留足間距以防串?dāng)_。矛盾就在這里:位寬要求線細(xì)、排密,速率要求線粗、間距大,兩者在同一塊有限的面積里互相爭(zhēng)搶。


③因此,要繼續(xù)顯著提升帶寬,大致有三條路:一是改進(jìn)Base Die的設(shè)計(jì)和工藝,讓信號(hào)發(fā)得更快、更準(zhǔn);二是改進(jìn)中介層,如加強(qiáng)線路屏蔽、增加布線層數(shù);三是縮短線路,位寬和速率在線寬上沖突,在線長(zhǎng)上卻不沖突,例如未來(lái)把HBM直接疊在XPU上方或下方的3D封裝。


三、做強(qiáng)單顆,還是以量取勝?抉擇在哪?


以上分別討論了提升容量和帶寬的路徑:提升容量的路多且方向各異,本質(zhì)都是在成本、容量、帶寬三者間取舍;提升帶寬則殊途同歸,需要在Base Die、中介層和封裝上死磕。


接下來(lái)的問(wèn)題是:行業(yè)會(huì)優(yōu)先解決容量還是帶寬?這又會(huì)如何影響內(nèi)存廠的地位?我們先從最直接的成本入手。


3.1、HBM比其他內(nèi)存貴多少?


雖然HBF尚未正式量產(chǎn),無(wú)從得知其最終的實(shí)際成本。但由于HBF的結(jié)構(gòu)和制作方法和HBM基本無(wú)異,區(qū)別僅在前者用NAND顆粒而后者用DRAM顆粒。那么從兩種顆粒間的定價(jià)差異能窺得一二。


那么根據(jù)TrendForce統(tǒng)計(jì)的最新合約價(jià)格可見(jiàn),DRAM和NAND相同容量的價(jià)差超8x,DRAM(DDR5規(guī)格)的單GB售價(jià)約為$16,而NAND(MLC規(guī)格)的單GB售價(jià)僅$1.9。



更重要的制造成本上,根據(jù)外行測(cè)算,HBM的單GB制造成本近期接近$5,且隨著規(guī)格提升有進(jìn)一步走高趨勢(shì)。而常規(guī)DRAM的單GB成本不到$1.2,且因工藝成熟還在繼續(xù)走低。這和HBM的晶圓損耗約是傳統(tǒng)DRAM 3~4x的說(shuō)法大體一致。


至于HBF,雖NAND顆粒相比DRAM便宜很多,但復(fù)雜的堆疊和封裝成本是相近的。根據(jù)不同的信息源,有說(shuō)HBF的成本是HBM的1/8,有說(shuō)HBF的成本是傳統(tǒng)NAND的10x,則對(duì)應(yīng)HBF每GB成本約$0.5-$1,相當(dāng)于HBM的1/5~1/10。


但HBF本質(zhì)是犧牲帶寬換高容量,HBF相比HBM每GB的價(jià)格折扣,正巧和HBF帶寬相比HBM的差距基本相當(dāng)。




另一個(gè)值得關(guān)注的現(xiàn)象是:HBM成本約為常規(guī)DRAM的4倍,售價(jià)差距卻在迅速縮小,近幾個(gè)月常規(guī)DRAM售價(jià)已達(dá)HBM的80%以上。海力士管理層年初曾表示,HBM毛利率僅約60%,常規(guī)DRAM則可達(dá)80%以上,成本低、工藝簡(jiǎn)單的常規(guī)DRAM反而更賺錢(qián)。


原因在于,HBM只供少數(shù)大客戶、以長(zhǎng)約鎖價(jià),無(wú)法靈活調(diào)整;常規(guī)DRAM客戶分散,可以隨行就市提價(jià)。這也印證了上篇的觀點(diǎn):HBM工藝雖復(fù)雜,但因綁定少數(shù)大客戶,內(nèi)存廠的議價(jià)權(quán)和價(jià)值量占比反而更低。不過(guò)據(jù)報(bào)道,新一輪HBM合約價(jià)有望從$15~17/GB上調(diào)至$20~30/GB,毛利率劣勢(shì)將有所緩解。


3.2、容量和帶寬,哪個(gè)更重要?


回到HBF與HBM的對(duì)比:若容量更重要,HBF更具性價(jià)比;若更看重帶寬,HBM反而便宜一個(gè)數(shù)量級(jí)。這也印證了海豚君的判斷:技術(shù)路線的選擇,很大程度上取決于未來(lái)的卡點(diǎn)更多在容量還是在帶寬。


卡在容量,后排內(nèi)存、HBF替代等路徑更可行;卡在帶寬,就只能死磕首排內(nèi)存的性能,或靠互聯(lián)增加系統(tǒng)內(nèi)的GPU和內(nèi)存數(shù)量,代價(jià)也更高。


那么,哪些情形會(huì)讓卡點(diǎn)更多落在容量或帶寬上?


①容量需求增長(zhǎng)更快的情形:模型參數(shù)不再大跨步提升(如從10T量級(jí)邁向100T量級(jí)),增長(zhǎng)主要來(lái)自用戶滲透率提升、上下文變長(zhǎng),或更多無(wú)需推理的執(zhí)行場(chǎng)景。


②帶寬要求更高的情形:模型總參數(shù)和激活參數(shù)繼續(xù)大幅提升,推理的思維鏈和上下文更長(zhǎng),用戶對(duì)Token生成速度的要求也更高。


3.3、三種情形:誰(shuí)是卡點(diǎn),誰(shuí)贏得更多


我們分情境假設(shè)來(lái)看:


①情境一,模型參數(shù)平穩(wěn),增長(zhǎng)主要來(lái)自用戶數(shù)、上下文長(zhǎng)度和Agent執(zhí)行場(chǎng)景的擴(kuò)張,對(duì)應(yīng)前文"容量需求增長(zhǎng)更快"的情形。


技術(shù)上,單顆HBM的層數(shù)和帶寬都無(wú)需大幅提升,新增容量更多由后排內(nèi)存、常規(guī)DDR和HBF來(lái)承接,分層混合的存儲(chǔ)架構(gòu)會(huì)更快落地。


此時(shí)工藝難度不再是主要矛盾,問(wèn)題變成純粹的供需匹配。存儲(chǔ)更像回到傳統(tǒng)的大宗商品邏輯:價(jià)格主要由供需決定,隨著27年后新增產(chǎn)能釋放和工藝成熟,單位成本和價(jià)格會(huì)逐步下行。


受益更多的是產(chǎn)能規(guī)模大、成本控制好的廠商,以及承接新增容量需求的NAND產(chǎn)業(yè)鏈(HBF、企業(yè)級(jí)SSD)。但這也是三種情境中最"周期"的一種:一旦各家(包括長(zhǎng)鑫等新進(jìn)入者)產(chǎn)能集中釋放,價(jià)格下行壓力最大,內(nèi)存廠的超額利潤(rùn)也最難維持。


②情境二:帶寬成為主要瓶頸——價(jià)值向封裝和代工外溢


這對(duì)應(yīng)"帶寬要求更高"的情形:模型總參數(shù)和激活參數(shù)繼續(xù)大跨步提升,推理的思維鏈更長(zhǎng),用戶對(duì)生成速度的要求也更高。


技術(shù)上,層數(shù)未必繼續(xù)走高,甚至可能像SemiAnalysis所說(shuō)的"降層多顆"。競(jìng)爭(zhēng)焦點(diǎn)從堆疊轉(zhuǎn)向Base Die的信號(hào)速率、中介層布線和3D封裝,卡點(diǎn)因此落在臺(tái)積電的CoWoS和先進(jìn)制程Base Die產(chǎn)能上。


存儲(chǔ)系統(tǒng)的總成本和稀缺性大概率繼續(xù)走高,但稀缺溢價(jià)更多被封裝和代工環(huán)節(jié)拿走。Base Die越來(lái)越多由客戶主導(dǎo)設(shè)計(jì)、交由臺(tái)積電制造,HBM進(jìn)一步定制化,內(nèi)存廠的角色更接近"顆粒供應(yīng)商",對(duì)少數(shù)大客戶的依賴也更深。


受益最多的是臺(tái)積電。內(nèi)存廠之間,能自行提供Base Die和封裝"一條龍"方案的主要是三星。


③情境三:容量和帶寬雙雙告急——內(nèi)存的"超級(jí)周期"


即參數(shù)規(guī)模再上臺(tái)階(如從10T量級(jí)邁向100T量級(jí)),同時(shí)用戶和上下文也在持續(xù)擴(kuò)張。


技術(shù)上,所有路徑都要同時(shí)推進(jìn):?jiǎn)晤w層數(shù)大概率要繼續(xù)堆高,同時(shí)帶寬也要提升,這時(shí)內(nèi)存的稀缺性和價(jià)格大概率會(huì)有最大的提升。DRAM晶圓和封裝產(chǎn)能雙雙告急。其中DRAM晶圓擴(kuò)產(chǎn)更慢,可能成為最硬的卡點(diǎn)。


這時(shí)內(nèi)存廠和封裝廠的價(jià)值都會(huì)提升,且相比情境二,內(nèi)存廠的議價(jià)權(quán)相對(duì)更高。因?yàn)楦邔訑?shù)堆疊的良率和鍵合工藝等是由內(nèi)存廠把控的。


需要注意,三種情境并非互斥。訓(xùn)練和前沿推理更吃帶寬,大規(guī)模Agent推理更吃容量;英偉達(dá)、AMD和各家ASIC也可能選擇不同的HBM配置。現(xiàn)實(shí)更可能是幾種情境并存,對(duì)應(yīng)前文的分層混合架構(gòu),區(qū)別只在于哪一種占主導(dǎo)。


3.4、尾聲


回顧全篇,容量上,往高處堆(更多層、更薄的顆粒、更先進(jìn)的鍵合),能讓新增的每一GB都掛在首排HBM的全速通道上,代價(jià)是工藝難度、良率和DRAM晶圓消耗的全面走高。用更多占地面積往多處擺(多排內(nèi)存、HBF、少層多顆),雖然工藝要求和單位成本更低,但要么犧牲帶寬,要么把壓力轉(zhuǎn)嫁給Base Die和CoWoS產(chǎn)能。


帶寬上則幾乎沒(méi)有捷徑。位寬和速率相互掣肘,要繼續(xù)大幅提速,只能在Base Die、中介層和3D封裝幾個(gè)方向上死磕,而這些環(huán)節(jié)恰恰大多不在內(nèi)存廠自己手里。


至于最終走哪條路,在于AI接下來(lái)的需求更多卡在容量還是卡在帶寬??ㄔ谌萘浚鎯?chǔ)回歸走量邏輯,產(chǎn)能和成本是勝負(fù)手;卡在帶寬,封裝和代工環(huán)節(jié)的話語(yǔ)權(quán)上升,內(nèi)存廠的議價(jià)權(quán)反而可能被稀釋。


而若兩者同時(shí)告急,內(nèi)存自身的工藝和產(chǎn)能會(huì)成為最硬的卡點(diǎn),內(nèi)存廠在產(chǎn)業(yè)鏈中的分量也最重。


目前海豚君認(rèn)為,容量需求提升是最高確定性,用戶、用量和Agent場(chǎng)景滲透率大概率是持續(xù)走高的。后續(xù)的關(guān)鍵就是看大模型參數(shù)規(guī)模提升斜率,來(lái)確認(rèn)帶寬的提升速度要求。


后續(xù)判斷落在哪種情境,可以重點(diǎn)跟蹤幾個(gè)信號(hào):


①英偉達(dá)、AMD及各家ASIC新品最終采用的HBM層數(shù)和顆數(shù);


②HBM4E的實(shí)際運(yùn)行速率,以及HBM5位寬翻倍的落地節(jié)奏;


③CoWoS與DRAM晶圓產(chǎn)能的相對(duì)擴(kuò)張速度;


④HBF在27年前后的首批導(dǎo)入情況等等。


至此,海豚君已完成了對(duì)存儲(chǔ)技術(shù)的梳理,且技術(shù)路線的分歧,最終都會(huì)落到每一家廠商身上。


在下一篇中,海豚君將把視角從行業(yè)拉回公司,從技術(shù)拉回到供需匹配,各廠商與核心客戶綁定的深淺,以及后續(xù)廠商們具體的業(yè)績(jī)走勢(shì),看看誰(shuí)更可能勝出。敬請(qǐng)期待!

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容來(lái)源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如涉及版權(quán)問(wèn)題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
沙田区| 阿荣旗| 寻乌县| 萨嘎县| 西和县| 若尔盖县| 福州市| 石城县| 延安市| 商河县| 马关县| 宜春市| 邢台县| 宁远县| 鄯善县| 杨浦区| 台山市| 错那县| 迭部县| 平度市| 马山县| 长顺县| 台湾省| 宝清县| 蒲城县| 银川市| 新昌县| 贵溪市| 余姚市| 建湖县| 阜宁县| 柳林县| 四子王旗| 丹阳市| 林甸县| 方山县| 朔州市| 鸡西市| 舟曲县| 稻城县| 高密市|