快科技 8 月 28 日消息,近日,小米玄戒 O100 AI 加速芯片与苹果新款 Mac mini 及 Mac Studio 先后亮相,两者均将内存带宽推至 TB/s 级别,这预示着喂饱 GPU 的数据之争已经打响。
这并非偶然,这一趋势与 2025 年初发布的英伟达 RTX 5090 不谋而合——无论是桌面 SoC、端侧 NPU 还是独立 GPU,都在将内存带宽推向新的高度,以解决 AI 大模型运行时数据搬运的瓶颈问题。
内存带宽是计算核心与数据之间的通道宽度。大语言模型在自回归生成阶段,每输出一个 Token,都需要将内存中数千亿参数的权重完整读取一遍。
计算单元再强大,大部分时间也在等待数据到达。这种 " 内存受限 " 现象已成为制约 AI 性能的关键瓶颈。
苹果 Mac 产品营销总监 Laura Metz 表示,M6 系列将内存带宽提升了数倍,因为运行 AI Agent 时模型必须驻留在统一内存中随时待命。
苹果 M6 系列的三档配置,恰好标出了 AI 硬件内存带宽的三个门槛。标准版 170GB/s,Pro 版 307GB/s,顶配 Ultra 版突破至 1.2TB/s。
小米玄戒 O100 采用晶圆级垂直堆叠技术,将 DRAM 晶圆直接压在 NPU 上方,实现 1.22TB/s 带宽。
英伟达 RTX 5090 通过 512-bit 位宽配合 GDDR7 显存,达到接近 1.8TB/s。
三家带宽齐冲 TB/s,虽然路径不同,但指向同一个结论:数据喂给计算核心的速度,决定了 AI 硬件的真实性能。
这项竞赛让内存带宽成为比核心数更值得关注的 AI 性能指标。谁能在数据搬运速度上建立优势,谁就能在下一个计算时代占据先机。

【本文结束】如需转载请务必注明出处:快科技
责任编辑:红茶


登录后才可以发布评论哦
打开小程序可以发布评论哦