雷锋网 23小时前
为什么手机内存进入英伟达机柜后,贵过HBM?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

过去长期由 HBM 主导的 AI 服务器内存账单,正在被 " 手机内存 " 改写。

8 月 11 日,外媒 Wccftech 援引美国银行(BofA)测算称,英伟达面向 Vera Rubin Ultra NVL144 的 Kyber 机柜将配置 124.4TB HBM4E,成本约为 250 万美元;同柜 216TB LPDDR5X 虽然单价更低,但总成本趋近 280 万美元,超出前者约 12%。

LPDDR5X 原本主要用于手机等移动设备,例如 iPhone 17 Pro 搭载 12GB LPDDR5X 内存。如果做一个换算,Kyber 单柜所使用的相当于约 1.8 万部手机的运行内存总量。

这并不是 LPDDR 第一次走进数据中心。早在 Grace CPU 时代,英伟达就已经开始用 LPDDR5X 代替传统服务器使用的 DDR。

三年后,新一代 Vera CPU 内存不仅形式发生改变—— SOCAMM2(Small Outline Compression Attached Memory Module 2,小型压接式内存模块)将原本固定式设计升级为可拆卸、可维护的服务器内存模块,单颗 CPU 的 LPDDR5X 容量也从 GB 级别提升至 TB 级别(1TB=1000GB)。

这个原本为手机等端侧设备而设计的兼顾带宽、容量和功耗的产品,正在迎来和 HBM 相似的境遇——越来越贵的同时,也越来越稀缺

01

为何曾经的手机内存能跑进 AI 服务器?

答案在于 CPU 的核心数持续增加,以及智算、超算等工作负载的数据量不断攀升。这些压力传导到内存端,转化为对更大容量和更高带宽的明确需求。

然而,传统服务器主内存所采用的 DDR5 RDIMM(寄存式双列直插内存模块),很难在控制功耗的同时,满足 CPU 对极致内存吞吐能力的追求。

图源 ServeTheHome YouTube 频道

于是,英伟达开始另辟蹊径,瞄准 LPDDR 这类低功耗手机内存。首款数据中心 CPU Grace 首次应用的 LPDDR5X,围绕 CPU 布置了多个内存通道,提供远高于手机场景的总带宽。

按照官方 2023 年披露的数据,相比当时典型的服务器 DDR5 内存方案,Grace 的 LPDDR5X 在成本相近的情况下,带宽最高可提升 53%;提供同样 1GB/s 带宽,所需的功耗也只有前者的约八分之一。

美光与 Meta 最新的联合测试更直观地展示了瓶颈如何被 LPDDR5X 解决:

一项 AI 数据整理任务的吞吐量,在内存速度提升后增加了11%;当容量翻倍、避免中间数据频繁写入 SSD 后,大数据分析任务速度甚至提高到原来的2 至 3 倍;在其中一项 AI 任务中,LPDDR5X 本身只占整机功耗的6.8%

当手机内存被搬进服务器,性能与功耗之间的平衡得以被维持。但下一个问题随之而来:传统移动设备的安装方式,未必适配服务器的工作节奏。

为了缩短信号路径、降低传输损耗,Grace 将 LPDDR5X 固定在 CPU 计算模块上。

这种设计往往意味着 LPDDR5X 一经损坏,就需要更换承载内存的整块计算板,并不符合服务器需要连续运行多年、故障部件必须能在现场快速替换的特性。

除此之外,供应端的灵活性也被削弱。在整机厂必须提前锁定内存容量和颗粒规格的情况下,已交付的服务器难以完成后续的迭代升级。一旦某种颗粒供应紧张,厂商也很难像更换 RDIMM 那样自如调整配置。

于是,将 LPDDR5X 模块化的 SOCAMM 应运而生。

但它没有继承 DDR5 RDIMM 的布局思路,而是借鉴了轻薄本内存的 CAMM(压接式内存模块)设计:

图源 Micron 官网

据美光测算,同等容量下,首代 SOCAMM 可提供 RDIMM 2.5 倍以上的带宽,占用面积约为后者的三分之一;其后续 SOCAMM2 的功耗也约为等容量 RDIMM 的三分之一。

在机架总能耗的约束下,SOCAMM 的低功耗优势还在被放大。

英伟达官方数据披露,一个 GB200 计算节点中的 4 个 GPU 模块(含计算及其配套 HBM)最大功耗合计 5.6kW,约占该节点 6.7kW 最大功耗预算的 84%。

GPU 模块已占据 AI 机架的大部分用电预算,CPU 内存的扩展不得不精打细算,而 SOCAMM 恰好击中痛点。因此,也不难理解为何英伟达会连续押注从 LPDDR 到 SOCAMM 的 CPU 内存赛道。

不过高带宽、低功耗、大容量的性能优势只说明了这条路线的可行性,却解释不了它正在发生的另一面——

当 AI 系统动辄消耗 TB 级别的 LPDDR 用量、更多厂商陆续下场押注,过去主要由手机周期主导价格和库存的逻辑,开始发生改变。

02

当只有六成需求被满足,英伟达或将减配

CPU 侧 LPDDR 的扩张,已经直接写进了英伟达新一代产品规格。

3 年前开始商用的 Grace CPU,单颗最高配置 480GB LPDDR5X;到了 Vera,这一数字提高到 1.5TB,是前者的 3 倍多。

放到整套系统里,Vera Rubin NVL72 的 36 颗 Vera CPU 合计配置 54TB LPDDR5X,而美国银行对下一代 Kyber 机柜的测算进一步来到 216TB。

容量一路向上,并不只是为了堆参数,而是为了匹配计算系统日益繁重的工作量。

Agent 兴起后,CPU 要承担的工具调用、代码运行和数据库访问不再是一次性动作,而是在单次任务中反复发生,并行任务也随之增加。

CPU 需要处理和搬运的数据更多,对内存容量和带宽的要求自然提高。

CPU 与 GPU 之间的内存分工也同步在施压。

通过一致性互连,一部分原本集中在 GPU 侧的容量压力被转移到 CPU 侧,有限且昂贵的 HBM 空间则留给对带宽更敏感的数据。

当两股需求最终都指向更大的内存容量和更高的传输带宽,存储厂也在顺着这一趋势继续提高 SOCAMM 容量。

目前三大 DRAM 原厂均已进入 SOCAMM2 量产阶段,美光还采用单颗 32Gb(约 4GB)的 LPDDR5X 裸片,将单模块 SOCAMM2 容量进一步提高到 256GB,目前处于客户送样阶段。

英伟达也不是唯一开始在服务器 CPU 上扩大 LPDDR 使用范围的芯片厂商。

今年 4 月,AMD 表示计划在 2027 年推出支持 LPDDR5X SOCAMM2 的 CPU,并将其作为未来 Instinct GPU 的配套主机。

TrendForce 同时称,英伟达之外的 ASIC 开发商也已经开始评估低功耗 DRAM。

其预计,到 2028 年至 2030 年,AI 服务器生态甚至可能超过智能手机,成为全球最大的 LPDRAM(所有低功耗的内存产品的统称,包含 LPSDRAM、LPDDR4、LPDDR5、LPDDR5X 等)单一终端市场。

SOCAMM 本身也在从英伟达率先采用的方案走向更广泛的行业标准。

今年 6 月,全球内存与固态技术标准的制定机构 JEDEC 正式规定 SOCAMM2 的电气与机械要求。这意味着更多厂商可以按照统一规范开发模块和平台。

但在新买家尚未大规模入场的当下,SOCAMM 所依赖的 LPDDR5X 供应已经趋紧。

TrendForce 今年 1 月指出,DRAM 原厂正把先进制程和新增产能更多转向服务器内存(主要指传统 DDR5 路线)与 HBM,留给 LPDDR 等其他产品的供给空间随之收窄。

除此之外,即便手机市场处在传统淡季,LPDDR5X 依然供不应求,价格继续上涨。

这意味着同源的 SOCAMM 也很难幸免。

而 SemiAnalysis 还指出,做成服务器模块的 LPDDR5X,还要再叠加更复杂的产品开发和更长的导入周期。

基于此,根据其 Memory Model 的进一步估算,英伟达 2026 年第一季度采购 SOCAMM 的合同价格约为8 美元 /GB,较 2025 年第四季度明显上涨,也高于同期约 6 至 7 美元 /GB的移动端 LPDDR5X。

SemiAnalysis 同时预计,到 2026 年末 SOCAMM 的价格可能超过 13 美元 /GB

价格上涨还只是第一层影响。当有限的 LPDDR5X 不足以填满所有 Vera CPU,供应挑战将进一步演变为分配难题。

面对紧张的供应问题,连英伟达都不得不考虑将 SOCAMM 减半。最早 SemiAnalysis6 月 4 日称,多数 Vera Rubin 系统可能采用 96GB 而非 192GB SOCAMM2,单颗 Vera CPU 的内存将由最高 1.5TB 降至 768GB。

一天后,黄仁勋被问及此事,只承认内存供应受限,并表示英伟达需要在不同系统之间更加合理地分配内存。

6 月 10 日,TrendForce 进一步量化了这道缺口。按照三星、SK 海力士和美光的 2027 年初步供货分配,英伟达能够获得的 LPDRAM 只能满足预计需求的约 60%

据其调查,为让有限的 LPDDR5X 支撑更多 Vera CPU 系统出货,英伟达选择将Vera Rubin 机柜所配的 SOCAMM 容量减半

两个月后,TrendForce 又在另一份报告中重申了这一判断,并称 LPDDR5X 供应紧张可能持续到2027 年

当前,英伟达尚未公开回应,但围绕 Vera 配置的多轮消息已经释放出一个信号——过去主要由 GPU 侧 HBM 引发的内存讨论,正延伸到 CPU 侧,并开始影响整套 AI 系统最终以什么配置交付。

内存还在约束 AI 计算系统的扩张。

雷峰网雷峰网 ( 公众号:雷峰网 )

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 ai 数据中心 youtube 美国银行
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论