智东西 昨天
AI时代数据存储架构如何创新?西部数据在WAIC公布路线图
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | ZeR0

编辑 | 漠影

智东西 7 月 21 日报道,世界人工智能大会 WAIC 2026 期间,西部数据通过参展与举行专题分论坛,全面呈现存储基础设施如何支撑 AI 的规模化发展。

数据如何被存储、管理与长期保留,已成为决定 AI 能否实现可持续、经济高效规模化发展的关键因素。

在展台上,西部数据展示了两项业界首创的先进 HDD 创新技术:高带宽硬盘技术双枢轴硬盘技术,以及 HAMR(热辅助磁记录)、ePMR(能量辅助垂直磁记录)和 UltraSMR 技术,并展现了这些技术如何与其平台产品组合相辅相成,专为满足规模化 AI 基础设施的需求而打造。

其中,高带宽硬盘技术通过多磁头在多个磁道同时进行读写,可在不增加功耗的前提下提供高达传统 HDD 2 倍的带宽。该技术具备清晰的拓展路径,未来可实现高达8 倍的带宽增益,目前已交付客户进行验证。

双枢轴技术在独立枢轴上增加了第二组独立运行的执行器,可在 3.5 英寸硬盘内提供高达2 倍的顺序 IO 性能增益 。这与以往牺牲容量且需要客户大幅度修改软件的双执行器设计不同,双枢轴技术通过缩小磁碟间距,在单个硬盘中搭载更多磁碟,从而提升整体容量。

通过这些技术的结合,西部数据将使硬盘顺序 IO 性能整体提升至4 倍,在实现 100TB HDD 的同时,仍能保持客户当前享有的每 TB 相对 IO 速率。这有效减少了客户在容量扩展过程中增加 SSD 部署或重构服务架构的需求。

西部数据还展出了面向大规模数据存储环境的多款 Ultrastar 企业级 HDD 解决方案,包括 40TB 和 34TB Ultrastar DC HC6100 数据中心 UltraSMR 硬盘、30TB 和 28TB Ultrastar DC HC5090 数据中心 CMR 硬盘、采用 HAMR 技术的 40TB Ultrastar DC HCS100 数据中心 UltraSMR 硬盘,以及采用高带宽硬盘和双枢轴技术的性能优化型硬盘。

值得注意的是,采用 UltraSMR ePMR 技术的 40TB HDD 现已进入客户认证阶段,并计划于2026 年下半年实现量产。

西部数据展出的精选先进存储平台解决方案,包括全新 Ultrastar Data60 3000 混合存储平台、OpenFlex Data24 4200 存储平台以及 RapidFlex C2000 网络交换桥接适配器,旨在支持可扩展部署、灵活的资源利用以及满足现代数据基础设施的要求。

7 月 19 日下午,西部数据举办以 " 面向 AI 时代的数据存储架构创新 " 为主题的分论坛。西部数据开发工程高级副总裁 Tim Rausch 发表主题演讲。

西部数据从一个关键差异点重新审视了 AI 基础设施:即计算周期可以重复利用,而数据会持续累积。

Tim 强调,AI 不仅是计算系统,更是数据系统,在其中训练和推理往复循环。每一次交互都会产生新的数据,这些数据可被存储、重新纳入训练并用于改进后续模型,使存储需求呈现持续性和累积性。如何高效管理这些海量数据,已成为行业面临的核心挑战。

他着重分享了三类工作负载:

第一类是训练数据,通常一次写入、存放在 HDD 上,并被周期性读取,因为模型并非始终处于训练状态。随着用户生成的内容回流到 AI 数据循环中,训练数据量会持续增长。这一层最看重的是能够扩展到 EB 级、且具有成本效益的存储,而这正是 HDD 的用处。

第二类是推理,例如我与 AI 交互,请它提供晚餐食谱或生成一张图片,同时还有数百万用户在以类似的方式使用 AI,这会产生大量随机小数据读取,还需要内存来保留对话上下文。因此,这一层既需要高带宽和高 IOPS,也需要持久化存储,这正是 SSD 发挥作用的场景。

第三类是推理输出,也就是 AI 为我生成的食谱、图片或其他内容。此外,AI 还会保留日志、追踪记录、合规记录和元数据。很多数据最初位于 HBM 或 DRAM 中,但很快会向下迁移到 HDD,进行持久化存储。

AI 存储栈与传统云应用使用的存储栈有所不同。传统应用可能主要依赖两个存储层级:闪存和 HDD。假设一个应用中有数千张图片,用户打开应用时最先看到的 10 到 20 张图片可能来自 NAND 闪存,以便快速呈现;继续向下浏览时,后续图片则从 HDD 加载,因为 HDD 更具成本效益。开发者会根据性能与成本的平衡,将内容放到合适的存储层。

AI 构建者采用同一套原则,但涉及到更多层级:

上层是模型权重 /GPU 显存溢出,即 HBM 或 DRAM 紧邻成本高昂的 GPU,以便持续向其供给数据。

下一层是 KV 缓存,也就是 AI 系统的短期记忆,主要使用 DRAM 和 SSD。

再下一层是语义数据库,其中包含向量、嵌入和检索增强生成(RAG)数据,通常运行在 SSD 上的高性能数据层。

最底层是 HDD 大容量存储,用来保存日志、用户生成内容的副本以及训练数据。

" 在规模化发展中,经济性决定架构。通过闪存处理性能敏感型小数据读取,由 HDD 承载不断累积的写入流,这种智能数据分层和均衡的存储架构不仅能够从容应对持续增长的数据规模,更让 AI 基础设施变得务实、优雅且经济可行。"Tim 说。

他展示了一个案例:生成一个 3.97MB 的视频需要在整个存储栈中完成 46.5GB 的读写,并在后端留下 506MB 数据。当推理输出被存储、重新纳入系统并用作合成训练数据后,便形成 " 模型改进—更多推理—更多输出被留存 " 的自我强化循环,持续扩大持久存储层。

Tim 认为,成功的 AI 企业会将数据放在正确的层级,并让数据在 AI 存储栈的 4 个层级之间持续迁移。

" 目前我们看到,约 80% 的 AI 内容存储在 HDD 上,20% 存储在 SSD 上。" 他谈道,他并不是主张 HDD 占据的市场份额应当提高,而是想强调数据总量本身正在增长,HDD 与 SSD 并不是在面临存量竞争,而是彼此互补,HDD、SSD、DRAM 和 HBM 应根据各自的性能和经济性部署在最合适的层级。

为应对持续累积的数据需求,西部数据分享了未来五年的发展路线图。

西部数据将采取 ePMR 与 HAMR 并行发展的路径,帮助客户更平稳地迈向2029 年单盘 100TB 以上的容量。

对于需要高性能的工作负载,西部数据将通过高带宽硬盘技术与双枢轴技术提供带宽与 IO 性能方面的增益。

针对 AI 交互生成并需要持久留存的数据,可通过功耗优化型 HDD 提供经济可持续的解决方案。

此外,西部数据还将利用其智能平台,将 HDD 的经济性和优势延伸至更广泛的客户群体。

评论
大家都在看