驱动之家 09-22
阿里云发布新一代自研存储:为百万卡加速 AI存储成本大降69%
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 22 日消息,2026 云栖大会上,阿里云正式推出面向下一代 AI 训练集群的新一代高性能存储 CPFS(Cloud Parallel File Storage)。

该存储可提供高达百 TB/s 级吞吐和亿级 IOPS,单文件系统规模提升 5 倍至 100PiB,为百万卡模型训练加速,支撑大规模模型训练和多模态数据处理。

在实际训练中,可将模型启动平均耗时降低 50%、峰值算力利用率提升 30%、AI 存储成本降低 69%,业务承载能力翻倍。

随着大模型训练进入规模化阶段,数据集由文本扩展至图片、视频和语音,规模可增长 50 倍甚至百倍;模型参数规模增长约 10 倍,Checkpoint 保存也更加频繁。海量小文件并发读取和 Checkpoint 突发写入由此成为新瓶颈,存储如果无法跟上,昂贵的 GPU 集群就会因数据供给不足而空转。

针对这一问题,新一代 CPFS 采用数据服务与元数据服务分离架构,实现容量和性能的水平扩展。GPU、CPU 节点通过 EFC 弹性客户端和虚拟存储通道,接入分布式元数据和数据服务;结合飞天盘古的分布式持久化存储底座和高性能存储网络,形成从客户端、协议处理到数据落盘的全链路自研链路。

据悉,新一代 CPFS 文件系统容量规模提升 5 倍、元数据性能提升 10 倍、文件数量规模提升 100 倍,单文件系统可扩展至百 PiB 并承载万亿级文件。企业无需为不同训练阶段反复拆分或迁移数据,即可在统一文件系统中管理训练语料、模型参数、Checkpoint 和实验结果,并随 GPU 集群同步扩展容量与吞吐。

针对冷热数据长期并存带来的成本压力,CPFS 还提供智能生命周期管理和冷热分层存储,使不同访问频率的数据自动匹配合适的存储介质,在保障训练性能的同时,整体存储成本最高降低 69%。

以 Qwen 大模型训练为例,采用新一代 CPFS 后,模型启动平均耗时降低 50%,峰值算力利用率提升 30%,业务承载能力翻倍。

面向大模型推理,阿里云同时推出 KVCache 加速引擎—— KVCacheStore。它位于 GPU 显存、主机内存与远端共享存储之间,是基于近计算部署、高性能网络和弹性共享存储构建的新型 G3.5 存储层,以 " 存储换计算 " 承接长上下文、多轮对话和复杂 Agent 任务产生的大量缓存。

KVCacheStore 支持与算力亲和部署,单计算节点吞吐达到 40GB/s,通过 Batch 接口实现百万 QPS,单实例可满足千亿级 KV 存储规模,实测缓存命中率提升 20% 以上。

" 每一次模型的跃迁,都是云存储自我革新的最佳契机。" 阿里云存储产品负责人蒋江伟表示,阿里云将持续推进算、网、存协同创新,让数据更快进入计算、GPU 得到更充分利用,为大模型训练和 AI 应用提供高性能、可扩展且成本可持续优化的存储底座。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里云 ai gpu 命中率
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论