AI 算力竞争正在进入一个新的阶段。过去几年,随着大模型规模快速增长,行业持续通过更强的 GPU、更大的集群和更高的内存带宽提升 AI 计算能力。但当模型进入长上下文、高并发推理阶段后,新的问题开始显现:
算力之外,数据如何更高效地到达计算单元,正在成为影响 AI 推理效率的重要因素。
而围绕这一问题,AI 芯片正在出现两条值得关注的技术演进路径:3D,是新的封装与集成方式;存算一体,是新的计算架构。前者关注的是计算与存储如何在物理层面进一步靠近,通过三维集成和高密度垂直互连缩短数据传输距离;后者关注的是计算与数据如何在架构层面进一步融合,让计算尽可能在数据侧完成。
而当 3D 集成与存算一体架构进一步结合,计算与存储之间的物理距离和数据搬运开销都有望进一步降低,这也成为下一代 AI 计算架构值得关注的方向。这一技术演进正在逐渐获得产业层面的验证。
9 月 10 日,英伟达宣布通过 NVLink Fusion,将 d-Matrix 下一代 Raptor 推理 XPU 接入其 AI 基础设施体系。值得关注的是,这款面向 AI 推理的芯片采用了 3D DRAM 堆叠架构。
从产业角度看,这一动作的意义并不只在于一款芯片进入英伟达生态。更值得关注的是,3D DRAM 正在从芯片架构领域的前沿探索,逐渐进入 AI 基础设施的系统级视野。
而当 3D DRAM 进一步与存算一体架构结合,新的技术想象空间也正在打开。为什么是 3D DRAM?又为什么是 3D DRAM 与存算一体的结合?

答案要从 AI 推理正在面对的 " 内存墙 " 说起。
AI 推理的瓶颈,正在从 " 算不动 " 走向 " 搬不动 "
大模型推理对计算资源的需求不断增长,但与此同时,模型权重、KV Cache 等数据规模也在快速扩大。尤其在长上下文和多用户并发场景下,AI 芯片需要持续从存储系统读取和交换大量数据。
这意味着,即使计算单元拥有足够强的算力,如果数据无法及时供给,计算资源也难以得到充分利用。因此,AI 推理面临的瓶颈正在发生变化:从过去更多关注 " 计算单元有多少 ",逐渐转向 " 数据能否以足够高的效率送到计算单元 "。这也是所谓 " 内存墙 " 问题的核心。
传统架构中,SRAM 速度快,但容量和成本受到限制;DRAM 容量大、成本效率高,但与计算单元之间存在一定的数据传输距离。HBM 则通过先进封装和高带宽互连,大幅提升了计算芯片访问内存的能力,目前仍是高性能 AI 计算的重要基础。
但随着模型规模、上下文长度和推理并发持续增加,单纯提高带宽并不能解决所有问题。当数据搬运本身成为系统开销,如何让数据与计算距离更短,就成为新的架构优化方向。
这也意味着,下一代 AI 芯片的技术演进,不仅是计算能力的提升,也包括封装、存储和计算架构的协同创新。
3D 是新封装,存算一体是新架构
3D DRAM 带来的,是计算与存储在物理层面的进一步靠近。通过三维集成和高密度垂直互连,计算裸片与存储裸片可以实现更加紧密的集成,从而缩短数据在计算与存储之间传输的距离。但仅仅让计算与存储 " 更近 ",并不等于解决了数据搬运问题。
存算一体进一步从架构层面改变计算与存储之间的关系,提升计算效率,降低缓存层级带来的数据搬运对计算效率的影响。因此,3D 堆叠与存算一体实际上解决的是两个不同层面的问题:3D 堆叠解决 " 距离 " 问题,存算一体解决 " 效率 " 问题。
3D 提供三维集成的物理基础,存算一体提供计算与存储融合的架构基础。二者结合,则是在物理层和架构层同时推动计算与数据进一步靠近。
这并不意味着 3D DRAM 会简单替代 HBM。在未来相当长一段时间内,不同存储和封装技术仍将针对不同的计算场景共同发展。3D DRAM 真正带来的变化,是为 AI 推理提供了一种新的架构选择;而当其与存算一体架构结合,则进一步为降低数据搬运开销、提升计算效率提供新的可能。
近期产业动态所释放出的信号是,3D DRAM 正在从技术研究逐步走向产业化,而 3D 集成与计算架构的协同,也正在成为 AI 芯片探索的重要方向。
从存算一体探索,到 3D DRAM 产品化
对于亿铸而言,围绕存算一体架构的探索并非始于近期。早期技术研发阶段,亿铸已经完成相关 AI 芯片的技术验证,并持续围绕计算架构、存储体系以及软硬件协同开展研发。

随着 AI 推理需求不断变化,亿铸进一步将技术路线延伸至3D DRAM 与通用存算一体架构的协同设计,从计算架构、存储系统、互连方式到软件体系进行全链路优化,探索面向云端 AI 推理的产品化路径。
软件侧,亿铸持续构建面向通用 AI 计算的软件体系,通过自研指令集、编译器、算子库以及 CUDA、PyTorch 等主流生态兼容能力,实现软硬件协同优化,降低客户迁移和部署成本。
从早期技术验证,到 3D DRAM 与通用存算一体架构的持续演进,再到面向云端推理的产业化落地,亿铸正在沿着这一方向持续推进。
AI 算力的发展,正在从单纯追求更高的计算峰值,逐步走向计算、存储与数据传输效率的系统级优化。
从 3D 集成带来的物理距离缩短,到存算一体带来的计算架构变化,计算与数据之间的关系正在被重新定义。随着相关技术持续演进,3D DRAM 与存算一体的结合,也有望成为下一代 AI 推理架构探索的重要方向。


登录后才可以发布评论哦
打开小程序可以发布评论哦