智东西 22小时前
刷新全球权威基准测试纪录!这家国产厂商在AI存储布局有多深?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

智东西

作者 | 杨京丽

编辑 | 李水青

智东西 9 月 17 日报道,9 月 1 日,全球权威 AI 性能评测组织 MLCommons 发布 MLPerf Storage v3.0 基准测试榜单。焱融全闪 AI 存储 F9000X在多项基准测试中拿下第一,充分验证其在极限 AI 训练负载下对高速网络带宽的高效利用能力

数据引用:MLPerf Storage Benchmark v3.0 Suite Results 2026

随着 AI 产业从模型训练走向规模化推理,存储系统需要处理的数据和承担的任务也在增加。训练阶段,存储要持续向 GPU 供给海量数据,还要快速保存和恢复模型 Checkpoint;推理阶段,系统又要管理不断膨胀的 KV Cache。单一的高性能存储产品已经难以覆盖 AI 全流程需求。

围绕 AI 的训练与推理场景,焱融已经构建起一套较为完整的全栈 AI 存储方案。F9000X 的测试成绩充分验证其训练侧能力:本次 MLPerf Storage v3.0 新增 KVCache 测试用例,进一步扩展了其对 AI 全场景工作负载的覆盖能力。

焱融科技近期推出的YRCache ContextBox 一体机,就是面向AI 推理场景的专属 KV Cache 存储产品,也是其全栈 AI 存储能力在KV Cache 管理、共享与复用方向的进一步落地。

从训练数据的高速读写,到推理上下文的共享与复用,焱融是如何应对 AI 不同阶段的存储需求?这套全栈 AI 存储方案又能为企业带来怎样的性能和成本价值?本文对此进行了深入解读。

一、三节点带宽刷新纪录,保证高效读写效率

大模型训练需要持续从存储系统读取数据。随着参与训练的 GPU 数量增加,存储系统需要同时为更多计算节点供给数据。如果数据吞吐能力不足,GPU 可能因等待数据而降低利用率。训练过程中还需要定期写入 Checkpoint,其读写性能会直接影响模型状态的保存和训练中断后的恢复耗时。

焱融 F9000X 是面向大规模 AI 训练推出的全闪存储产品,其训练侧实力可以从 MLPerf Storage 基准测试中得到验证。测试环境包括 3 台 F9000X 存储节点和 9 台 x86 客户端服务器,节点通过 NDR400 高速网络互联。

3D U-Net 模型训练测试对存储系统的持续带宽输出能力和极限负载稳定性,提出了较高要求。测试中,F9000X 三节点集群实现544GiB/s 聚合带宽,位列该场景第一,达到了历届公开测试成绩中的最高水平。相比此前 v2.0 测试的 478GiB/s,其聚合带宽进一步提升,表明存储系统能够更高效地向 GPU 提供训练数据。

在 Checkpoint 70B 测试中,焱融存储集群实现 539GiB/s 的读带宽和 314GiB/s 的写带宽,读写性能均位居第一,刷新历届 MLPerf Storage 公开测试成绩。对于千亿级、万亿级模型训练,Checkpoint 是保存阶段性训练状态的关键数据。更快的读写速度,可以缩短模型存档和恢复耗时,降低训练中断造成的算力浪费。

对企业而言,焱融 F9000X 更高的带宽表现不仅能够加快训练数据读写,也有望在满足同等训练需求的情况下减少存储节点投入,从而降低整体硬件投入成本。

二、AI 进入推理阶段,存储开始管理模型上下文

随着 AI 进入推理阶段,存储系统关注的重点转向模型上下文的管理与复用。长文本、多轮对话和 Agent 应用会产生大量 KV Cache,如果这些缓存无法被保存和复用,模型就需要反复计算相同的上下文。与此同时,推理请求的上下文更长、并发更高,KV Cache 需要在不同节点之间共享、迁移和复用。

针对这一问题,焱融推出AI 原生推理存储系统 YRCache,对不同层级的 KV Cache 资源进行统一管理,并将部分缓存从 GPU 显存卸载至主机内存和本地 SSD,减少重复计算。

在 YRCache 的多级缓存架构中,G1 是GPU HBM,负责保存当前最活跃、访问频率最高的 KV Cache;G2 是主机 DRAM,用于承接暂时无法放入 GPU 显存的缓存;G3 是本地 SSD,容量更大、单位成本更低,适合保存单节点中的更多缓存;G4 则是传统共享分布式存储,主要承载模型、数据集和 Checkpoint 等需要长期保存的数据。

随着推理集群扩大,本地 SSD 与传统共享存储之间出现了新的能力空档。参考英伟达 CMX 架构对 G3.5 Context Memory 的设计,焱融在 YRCache 体系中引入了G3.5 共享缓存层,并推出YRCache ContextBox 一体机,面向长上下文、多轮对话和 Agent 推理提供跨节点共享的 KV Cache 空间,在靠近计算的同时支持缓存共享、复用和独立扩展。

三、补上共享缓存层,KV Cache 实现跨节点复用

YRCache ContextBox 面向 G3.5 共享缓存层设计,将计算、网络、存储和软件协同起来,为推理集群提供独立的共享 KV Cache 空间。焱融科技称,ContextBox 单台实测带宽达 120GB/s,可支持 8 个推理节点并发接入,缓存容量可扩展至 PB 级。

YRCache ContextBox 首先让不同推理节点能够共享已经生成的 KV Cache。请求即使被调度到另一台服务器,也不必重新计算相同的上下文。与此同时,缓存不再受单台服务器的显存、内存和 SSD 容量限制,企业可以单独扩展缓存空间;即使计算节点增减,已经保存的缓存也不会随之丢失。

据焱融科技介绍,在某头部 AI 企业测试中,8 张 NVIDIA H20-3e GPU 运行 SGLang 和 GLM-5.1,输入上下文为 31K 至 129K 时,接入 ContextBox 后首 Token 时延降低 89% 至 94%,Token 吞吐提升 3 至 6 倍

ContextBox 还兼容 YRCache、LMCache、Mooncake 等管理软件,为长上下文、多轮对话和 Agent 推理提供共享、可扩展的上下文基础设施。

四、从训练到推理,AI 存储还要算效率和成本账

作为国内较早、较完整面向 AI 全流程构建全栈 AI 存储能力的厂商之一,焱融已形成覆盖 AI 训练与推理的存储方案,以 F9000X、YRCache 推理存储系统和 YRCache ContextBox 一体机为代表,覆盖训练数据读取、模型状态保存以及 KV Cache 管理等关键环节。

这套布局对应了 AI 应用的不同阶段:训练时,F9000X 提升数据和 Checkpoint 的读写效率,减少 GPU 等待;推理时,YRCache 和 YR Cache ContextBox 管理、共享并复用 KV Cache,减少重复计算。

对企业而言,这套方案的价值不只是提升带宽或降低时延,更在于让现有算力基础设施承载更多训练任务和推理请求。存储效率提高后,企业不必只依靠增加 GPU 或存储节点来扩大 AI 服务能力。

性能之外,成本也是 AI 基础设施建设的重要考量。焱融科技称,其单位性能硬件成本较行业市场平均水平降低约 35%,同时Token 效能提升 120%。在提升 AI 存储效率的同时,能够更好地控制基础设施投入。

从训练数据供给,到模型状态保存,再到推理上下文复用,焱融试图用一套覆盖全流程的存储方案,减少算力等待和资源浪费,让企业已经投入的 GPU、网络和存储设备发挥更大价值。

结语:从高吞吐到高复用,AI 存储进入全流程竞争

当 AI 竞争进入规模化应用阶段,存储不再只是后台的数据底座,而成为影响 GPU 利用率、推理效率和建设成本的关键基础设施;焱融通过覆盖训练与推理场景的全栈 AI 存储方案,帮助企业把算力和基础设施投入用得更充分。

随着模型规模、上下文长度和并发请求继续增加,AI 存储的竞争也将从单一的峰值性能,转向对不同数据、不同层级和不同使用周期的协同管理。AI 基础设施的建设越来越需要以更可控的成本承载更多训练任务和推理请求。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai gpu 智东西 一体机
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论