header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

摩根士丹利解讀:AI記憶體荒難解,輝達為什麼反而「減配」?

閱讀本文需 24 分鐘
存儲短缺催生新架構,Cerebras、Marvell等有望受益
TL;DR:
AI 記憶體短缺可能貫穿整個週期。摩根士丹利認為,模型規模、上下文長度和推理併發量持續增長,將不斷吸收新增存儲供應。
英偉達開始為 Rubin 提供「減配」方案。部分 HBM 和 LPDDR5 容量可能下調,但需求並未消失,而是向 NAND、DRAM 和高速互連轉移。
AI 推理架構正在重構。Prefill 與 Decode 分離,有望提高硬體利用率,為 Cerebras、英偉達 Groq 等技術方案創造機會。
CXL 有望成為新的增長點。摩根士丹利預計,2030 年相關半導體市場規模約達 60 億美元,Astera Labs 和 Marvell 是潛在受益者。
存儲股的關鍵是週期持續時間,而非短期漲價幅度。摩根士丹利維持增持美光和閃迪,主要風險在於 AI 投資及數據中心建設放緩。


編者按:AI 的下一道瓶頸,可能不再是 GPU 數量,而是記憶體。隨著大模型規模擴大、上下文窗口增長,以及 AI Agent 持續消耗更多推理資源,HBM、DRAM 和 NAND 的供應壓力正在向整個數據中心傳導。更值得關注的是,面對存儲短缺,英偉達正在探索為下一代 Rubin 平台提供更低記憶體配置的產品方案,以維持系統交付和部署節奏。


這提出了一個看似矛盾的問題:如果 AI 對存儲的需求如此旺盛,為什麼晶片廠商反而開始考慮減少記憶體容量?記憶體「減配」是否意味著需求即將見頂,還是說明供應瓶頸已經嚴重到迫使整個產業調整技術路線?


摩根士丹利半導體分析師 Joseph Moore 等人在 10 月 5 日發布的研報《How Can the AI Ecosystem Work Around Memory Bottlenecks?》中提出,存儲短缺可能持續貫穿當前 AI 週期,但 AI 建設不會等待 DRAM 晶圓廠完成擴產。行業需要通過降低部分產品配置、拆分推理任務,以及提高記憶體共享效率等方式,繞過現有供應限制。


這意味著,AI 硬體的競爭可能從單純增加 GPU 和記憶體容量,進一步轉向整個計算系統的資源利用效率。存儲短缺並不必然削弱存儲廠商的長期需求,卻可能改變產業鏈的價值分配。除了美光、閃迪等存儲企業,Cerebras、Astera Labs 和 Marvell 等擁有特殊計算架構及互連技術的廠商,也可能從中獲得新的增長機會。


以下為原文編譯:


AI 基礎設施建設正在面臨一個越來越難以解決的問題:算力可以通過採購更多 GPU 擴張,但記憶體供應並不能以同樣的速度增加。


摩根士丹利認為,在可預見的未來,AI 需求可能持續吸收大量新增存儲供應。即使不同時期的緊缺程度有所波動,DRAM 產能擴張仍難以迅速消除供需缺口。


在與計算行業企業的交流中,摩根士丹利發現,如何繞過記憶體瓶頸已成為越來越重要的話題。英偉達 CEO 黃仁勳也談到了通過計算、網絡和存儲系統的協同設計緩解供應限制的必要性。


分析師認為,這不是對存儲需求轉弱的預警,而是整個 AI 產業不得不面對的現實:當記憶體無法按原計劃供應時,企業必須找到新的系統架構,讓現有硬體繼續支持 AI 增長。


一、英偉達開始給 Rubin「減配」,存儲瓶頸卻沒有消失


最直接的辦法,是減少單台伺服器或單個 GPU 所使用的記憶體容量。


摩根士丹利指出,DRAM 和 NAND 供應緊張及價格上漲,正在迫使 AI 產業鏈重新考慮產品配置。對於晶片廠商而言,與其堅持原有規格、導致系統無法按計劃交付,不如提供不同記憶體容量的版本,讓客戶根據實際需求選擇。


研報預計,英偉達可能為 Rubin 平台提供多種較低記憶體配置。


在機架級記憶體方面,Rubin 原先規劃的 LPDDR5 容量約為 54TB,而部分新配置可能降至 28TB,對應 SOCAMM2 記憶體模組容量從 192GB 降至 96GB。


在 HBM 方面,Rubin 單 GPU 原先預計配備 288GB HBM4,採用 8 組 12 層堆疊設計;摩根士丹利預計,英偉達可能增加配備 192GB HBM4 的產品版本,將堆疊層數降至 8 層。


對於 Rubin Ultra,研報認為,在調整為雙計算芯粒方案後,512GB 是更合適的比較基準,未來可能出現約 192GB 至 384GB 的不同容量選擇。


這些均屬於摩根士丹利截至研報發布日對產品配置的判斷,並非所有規格都已得到英偉達正式確認。


從成本角度看,這種策略有其合理性。降低 HBM 堆疊層數可以減少容量,而在接口數量和引腳速率等條件不變時,理論帶寬不一定同步下降。


但容量和帶寬解決的是兩個不同問題。對於模型較小、上下文較短的應用,降低容量可能影響有限;但當模型越來越大、推理任務越來越複雜時,內存容量不足仍可能導致更多數據需要在不同存儲層級之間轉移,增加延遲或 GPU 使用量。


更重要的是,減少 HBM 並不會讓 AI 原本需要處理的數據消失,只會讓這些數據尋找新的存放位置。


例如,當 GPU 的 HBM 容量不足時,部分數據可能需要保存在主內存中;當機架級 LPDDR5 容量降低時,部分 KV Cache(鍵值緩存)需求又可能轉向 NAND 閃存。


KV Cache 是大模型推理過程中用於保存歷史計算信息的緩存。隨著上下文變長、同時運行的請求增加,其容量需求也隨之上升。


存儲需求不是消失,而是向其他層級轉移。


摩根士丹利指出,英偉達降低部分 LPDDR5 配置的同時,產業鏈已經觀察到來自 NAND 的新增需求。HBM 容量減少還可能增加 GPU 間的數據傳輸,使高速互連網絡承擔更大壓力。


這意味著,英偉達的減配策略可能暫時緩解 DRAM 供應約束,卻同時增加對 NAND、互連芯片以及更大規模 GPU 集群的需求。


這種壓力轉移有其長期背景。


根據研報引用的 Epoch AI 歷史數據,大語言模型時代的前沿模型參數規模曾呈現約每六個月翻倍的增長趨勢。上下文窗口也經歷了快速擴張。同時,更多 AI 應用從簡單問答轉向編程、複雜推理和長時間運行的 Agent 任務,進一步推高內存使用量。


摩根士丹利認為,模型規模、上下文長度和推理併發量將繼續推動存儲需求增長。因此,降低部分產品配置更可能是供應緊張時期的過渡方案,而不是 AI 內存需求長期下降的信號。


二、AI 推理開始「拆開做」,GPU 不再包辦所有任務


如果說減少內存配置是短期應對措施,那麼改變 AI 推理的計算方式,則可能帶來更深層次的產業變化。


摩根士丹利關注的第二條路徑是 Disaggregated Inference(解耦式推理),即將原本集中在同一套計算系統中的不同推理任務拆開,分別交給更適合的硬件執行。


傳統大模型推理主要包含兩個階段。


第一個階段是 Prefill(預填充),即處理用戶輸入的提示詞、文件或歷史上下文,並進行大量並行計算。這一階段通常更依賴計算性能。


第二個階段是 Decode(解碼),即模型逐個生成輸出 Token。這個過程需要反覆訪問模型權重和 KV Cache,因此更加依賴內存帶寬、容量及數據訪問延遲。


過去,同一套 GPU 往往同時承擔這兩類任務。但隨著推理需求擴大,這種配置未必總是最有效率的選擇。


摩根士丹利認為,更合理的方向可能是讓計算密集型硬件負責 Prefill,再由針對低延遲和高帶寬優化的架構承擔 Decode。


這種方式不僅能夠提高硬件利用率,還可以讓數據中心分別擴張兩種計算資源,而不必為所有任務配置完全相同的 GPU 和 HBM。


Prefill 與 Decode 的技術區別


其中最直接的潛在受益者之一是 Cerebras。


Cerebras 採用晶圓級處理器架構,將大量計算單元和 SRAM 集成在同一塊芯片上。SRAM(靜態隨機存取存儲器)容量密度通常低於 DRAM,但具備低延遲、高帶寬的特點,適合某些需要頻繁讀取數據的推理任務。


透過讓計算單元更靠近資料,Cerebras 能夠減少外部記憶體存取需求,提高特定推理環節的處理速度。


摩根士丹利指出,Cerebras 已與 AMD、AWS 展開合作,探索將不同處理器組合成統一的推理系統。


在 AMD 與 Cerebras 的聯合方案中,AMD Helios 負責更偏計算密集型的 Prefill 和大上下文處理,Cerebras 晶圓級引擎則負責 Decode。研報預計,該方案將在 2026 年第四季度進入生產階段。


AWS 採用類似思路,透過 Trainium 處理 Prefill,再由 Cerebras 處理 Decode,相關組合方案預計於 2027 年第一季度進入 Amazon Bedrock。


根據 Cerebras 和 AMD 披露的特定方案效能數據,兩者結合有望在維持 Cerebras 推理速度的同時,實現最高約五倍的吞吐量提升。這並不意味著所有推理任務都能獲得同等提升,但說明針對不同任務配置硬體,可能顯著改善系統經濟性。


對 Cerebras 而言,這種變化不僅意味著更多晶片銷售機會。由於公司還經營自己的推理雲端服務,如果相同硬體能夠生成更多 Token,單位 Token 成本就可能下降,從而改善毛利率,或為降低客戶價格提供空間。


輝達也在探索類似方向。


透過整合 Groq 相關技術,輝達正在將基於 HBM 的 GPU 與採用高速 SRAM 的 LPU 架構相結合。研報描述的方案中,Rubin GPU 負責 Prefill 及部分需要大容量快取的解碼計算,而 Groq 架構承擔更適合其低延遲特性的運算,由 NVIDIA Dynamo 軟體協調不同處理器之間的任務。


值得區分的是,輝達與 Groq 在 2025 年達成的是技術授權及人才引進安排,並非對 Groq 公司的完整收購。


摩根士丹利認為,隨著推理開支增長速度超過訓練,針對不同推理環節優化的異構計算架構可能獲得更大市場空間。按照研報的基礎設施支出預測,到 2030 年,推理預計占 AI 基礎設施支出的約 56%,訓練占比約為 44%。


這也為 AI 晶片行業帶來新的競爭邏輯:未來衡量一套 AI 系統競爭力的指標,可能不僅是峰值算力,還包括每秒生成多少 Token,以及生成每個 Token 需要多少成本。



三、CXL 市場有望達到 60 億美元,記憶體互連成為新機會


除了改變推理任務的分配方式,摩根士丹利還重點關注如何提高現有記憶體資源的使用效率。這正是 CXL 技術的機會所在。


CXL(Compute Express Link,計算快速互連)是一種高速互連協議,能夠讓處理器更靈活地存取外部記憶體,而不必始終依賴直接連接在本地的 DRAM。


傳統伺服器中,記憶體資源往往與特定 CPU 綁定。即使一台伺服器有大量閒置記憶體,也很難直接供另一台伺服器使用。CXL 則透過記憶體擴展、共享和池化,提高資料中心對 DRAM 的整體利用率。其中,記憶體擴展可以為單個處理器提供額外容量;記憶體共享允許多個處理器存取相同的記憶體資源;記憶體池化則將分散的記憶體組織成統一資源池,根據工作負載動態分配。


這種技術過去更多應用於傳統 CPU 計算環境,因為 CPU 工作負載相對更容易接受外部記憶體帶來的額外存取延遲。相比之下,AI GPU 長期依賴 HBM 提供極高的資料頻寬,CXL 連接的外部 DRAM 難以直接替代 HBM。


但隨著 AI 推理需求變化,這種架構的價值正在上升。


例如,長上下文推理需要保存大量 KV Cache,但並不是所有快取資料都必須始終留在最快的 HBM 中。系統可以將效能敏感的資料保留在 HBM,把部分存取頻率較低、對延遲要求相對寬鬆的資料轉移到外部 DRAM。


這樣既可以緩解昂貴 HBM 的容量壓力,也可以提高已有 DRAM 的利用效率。


摩根士丹利認為,AI 正在推動 CXL 從傳統伺服器記憶體擴展走向更廣泛的加速器記憶體連接與共享市場。


過去,Astera Labs 曾將 CXL 記憶體控制器的潛在市場規模估計在 40 億美元以上。摩根士丹利目前預計,隨著 AI 推理、KV Cache 卸載和機架級記憶體池化需求增長,到 2030 年,CXL 及相關記憶體連接半導體的潛在市場規模有望達到約 60 億美元。



需要強調的是,這一數字屬於分析師對潛在市場空間的預測,並非已經實現的市場收入。


在具體公司方面,研報重點關注 Astera Labs(ALAB)和 Marvell(MRVL)。


Astera Labs 的機會主要來自 Leo 內存控制器產品。摩根士丹利指出,公司預計標準化和定制化 Leo 產品將在 2027 年於兩家美國大型雲服務商客戶中開始規模放量,其中包括面向 AI 推理的 KV Cache 卸載設計。


Marvell 則通過 Structera X 和 Structera S,分別佈局內存擴展與機架級內存池化。公司此前預計,CXL 業務有望在 2028 年左右貢獻超過 10 億美元的收入。


對於這兩家公司而言,AI 存儲短缺可能使原本推廣較慢的 CXL 技術獲得新的商業需求。


不過,摩根士丹利也承認,CXL 市場的實際規模仍難以精確預測。不同雲廠商可能選擇非 CXL 互連技術、更大容量 HBM,或者基於閃存的緩存方案,最終市場採用速度可能與當前預期存在明顯差異。


因此,CXL 的投資邏輯能否兌現,仍需要觀察雲廠商實際部署進度、產品出貨量及相關業務收入。


四、內存減配未必利空美光,真正的風險是 AI 建設放緩


對於存儲產業鏈而言,英偉達降低部分內存配置似乎並不是好消息。如果單個 GPU 的 HBM 容量下降,單機架 LPDDR5 用量減少,存儲廠商能夠出售的內存數量就可能低於原先規劃。


摩根士丹利承認,從短期利潤最大化的角度看,這確實可能削弱存儲廠商原本能夠獲得的部分需求和定價機會。但分析師認為,這不應簡單理解為存儲週期即將結束。關鍵在於,當前的減配主要是受供應約束推動,而不是因為客戶不再需要那麼多內存。


當 AI 廠商希望採購更多 DRAM,卻無法獲得足夠供應時,降低配置可以幫助其維持系統交付。未來供應增加之後,廠商仍有動力重新提高配置水平。這意味著,當前未被滿足的需求可能形成一定的後續採購空間。


基於這一判斷,摩根士丹利更關注存儲行業景氣週期的持續時間,而不是短期價格上漲的最高幅度。如果 AI 模型持續擴大,Agent 應用不斷增加,推理並發量繼續增長,那麼即使 DRAM 廠商提高產能,新增供應也可能被快速吸收。


因此,摩根士丹利維持對美光(MU)和閃迪(SNDK)的 Overweight(增持)評級,認為存儲供應緊張不會迅速結束。


但這並不意味著存儲行業可以完全擺脫週期風險。研報認為,最核心的風險仍然來自 AI 需求本身。如果模型開發、推理應用或算力投資增速明顯下降,計算與存儲產業鏈都可能受到衝擊。


此外,還有一種更複雜的情況:AI 需求仍然旺盛,但數據中心建設因為土地、電力或基礎設施限制而延遲。在這種情景下,存儲產品可能已經完成生產,卻因為伺服器部署延後而無法按預期被消化,進而造成階段性的供需失衡。


摩根士丹利認為,這類建設瓶頸可能對存儲廠商形成額外擾動,甚至使其短期表現與部分計算芯片企業出現分化。因此,未來判斷存儲週期是否能夠延續,不能只觀察 DRAM 價格和 HBM 訂單,還需要追蹤 AI 基礎設施的實際部署進度。


AI 存儲短缺的最終影響,可能並不是讓產業減少使用內存,而是迫使行業重新決定:哪些數據必須留在 HBM,哪些可以轉移至 DRAM 或 NAND,以及哪些計算任務應該交給不同類型的芯片。


對於投資者而言,接下來需要關注的核心變量也逐漸清晰:Rubin 實際出貨配置是否降低、解耦式推理能否實現商業化規模部署、CXL 產品能否在 2027 年按計劃放量,以及 AI 數據中心建設是否繼續消化新增存儲供應。


如果這些技術調整能夠維持 AI 系統部署,同時長期存儲需求繼續增長,那麼存儲與互連產業鏈可能共同受益;但如果 AI 投資放緩,或者電力與土地限制持續阻礙數據中心落地,當前的供需緊張也可能面臨重新定價。


這正是摩根士丹利對本輪 AI 存儲週期最重要的判斷:行業真正需要解決的不是如何等待更多內存,而是如何在內存始終稀缺的情況下,繼續擴大 AI 的計算能力。



歡迎加入律動 BlockBeats 官方社群:

Telegram 訂閱群:https://t.me/theblockbeats

Telegram 交流群:https://t.me/BlockBeats_App

Twitter 官方帳號:https://twitter.com/BlockBeatsAsia

举报 糾錯/舉報
選擇文庫
新增文庫
取消
完成
新增文庫
僅自己可見
公開
保存
糾錯/舉報
提交