大数据在线 19小时前
AI推理越跑越复杂,新时代存储应当如何求变?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

沿着旧地图,永远找不到新大陆。

当 DeepSeek V4 上下文窗口达到百万 Token,当智能体推理请求从单轮对话变成多轮长程交互,当 AI 工作负载演变为多步骤链式复杂工作流,KV Cache 数据量也迎来爆炸性增长。如今,业界愈发形成共识:即 KV Cache 已不再是 AI 推理过程中的 " 边角料 ",而是决定单位 Token 成本、推理效率和运营成本的核心数据资产。

因此,随着人工智能重心从 " 训练 " 转向 " 推理 ",存储需求也随之出现结构性的改变。那么,在智能体新时代全面到来之际,存储产品又应当如何求变?

近日,中科曙光率先出招,正式发布全新迭代升级的 AI 推理原生存储 FN NEO,以 " 共享 KV Cache 池 " 为核心理念,通过极致融合能力实现一站式的 AI 推理全场景支持,同时以灵活的扩展性为将来后续智能体持续爆发后做好准备,真正为 AI 推理场景带来 " 快、稳、开放、焕新 " 四大维度的全新改变。

智能体时代的推理 " 焦虑 "

信通院最新数据显示,截至今年 6 月份,我国日均 Token 调用量激增至近 175 万亿。

Token 调用量爆发性增长的背后,是 AI 推理时代的全面到来。Gartner 相关研究显示,智能体的爆发,使得 AI 推理成为算力、存储消耗的主要模式,预计 2026 年推理导向 AI 基础设施支出预计增长 55%,AI 推理工作负载占比的持续增长将彻底重塑基础设施。

事实上,业界普遍认为,随着智能体开始深入融入到千行百业的各种业务场景之中,其自主运行、高频访问的背后是底层数百上千轮的上下文交互、数十万计 Token 的输入以及步骤链式复杂工作流,而 KV Cache 已不仅仅是 AI 推理过程中的临时缓存,而具备了成本高昂、复用价值巨大、急需生命周期管理以及跨节点共享等特征的 " 核心数据资产 "。

更加关键的是,这种 " 越跑越复杂 " 的 AI 推理模式已让现有基础设施达到其极限,不少用户因此陷入 AI 推理 " 焦虑 "。那么,如何妥善管理并高效复用如此庞大规模的 " 核心数据资产 "?业界一度认为,采用本地存算一体节点来堆叠 KV Cache 缓存层的方案是极佳解决方案。

但现实有些 " 反常识 ",各种实践表明,存算一体的本地节点方案存在着两大不可忽视的痛点:

其一、存算一体节点各自保存 KV Cache,使得资源跨节点共享困难,智能体推理调度到其他节点时候容易陷入重复计算,造成资源浪费、延迟飙升和效率低下。

其二、存算一体方案无法提供 " 又低又稳 " 的尾延迟保障,在 AI 推理链路中,决定系统体验和 SLA 的不是 " 平均延迟 ",而是 P99、P99.9 这类最慢请求的 " 尾延迟 ",而存算一体方案极易引发性能断崖式下跌,拖垮整个集群的吞吐。

中科曙光集中式存储产品部总经理郭照斌直言:" 存储已能直接影响 AI 推理的效能。在提升存储能力和降低存储成本的同时,来提高同等算力配置下的 Token 输出效率,是当前存储的关键方向。"

因此,集中式存储开始备受重视,其存算分离和资源池化的特性,在金融、电信等核心交易场景多年锤炼出来的稳定性与可靠性,以及数据统一管理等特性,使之智能体时代存储主动求变的关键突破口。

FN NEO:一站式支撑 AI 推理全场景

面向 KV Cache 带来的变革性存储需求,中科曙光的解法是推出专为 AI 推理设计的集中式全闪存储 --FN NEO,首次将集中式全闪存储纳入 KV Cache 分层体系中,让多个计算节点之间共享一套存储,推动集中式存储从 " 共享数据 " 演进为 " 共享 KV Cache"。

过去,存储在整个 AI 推理链路体系更多属于被动型的配套资源;如今,以 " 共享 KV Cache 池 " 为核心理念的 FN NEO 出现,标志着存储成为主动参与算力效率、Token 产出的核心基础设施,为 AI 推理场景带来 " 快、稳、开放、焕新 " 四大维度的主动改变。

具体来看,首先是 " 快 ":FN NEO 延续曙光高端集中式存储的性能基因,单阵列带宽高达 160GB/s,NAS 协议带宽达到 70GB/s,能提供稳定的亚毫秒级物理延时;同时,FN NEO 深度融入 KV Cache 卸载与加载链路,能让 TTFT(首字延迟) 缩减 73%,Token 吞吐能力提升 150%。

"FN NEO 采用了 SAN+NAS+KV 一体化架构,实现原生三协议的直出和极短路径,并且实现统一数据池,资源调度灵活。同时,利用超级隧道技术实现软件、硬件资源的高效规划,并通过全链路的负载均衡、KV 原生语意卸载实现整个存储的极致性能。" 郭照斌介绍道。

其次是 " 稳 ",在智能体长程任务的推理中,稳定性即生产力,一旦 SSD 或者控制器发生故障,集群就容易发生长尾抖动,甚至导致推理过程中断。而 FN NEO 拥有 99.999% 的金融级高可靠性,并具备四重技术保障长程推理过程中 TTFT、TPOT 和端到端延迟的稳定性。

郭照斌介绍,"FN NEO 的应用全局镜像缓存技术、RAID-QC 硬盘冗余技术、自动缩列修复技术和亚健康盘与慢盘自动隔离等四重技术带来了极高的可靠性,确保 AI 推理对‘尾延迟’的敏感需求。"

第三是 " 开放 ",目前 AI 推理的技术生态正在快速演进,整个技术栈不仅涉及到众多厂商的多种技术,且推理链路中各类技术频繁切换已是常态,因此破除 " 生态锁定 " 就成为大势所趋。

FN NEO 的测试了提供推理框架层兼容、组网部署层适配和操作系统层兼容的三重开放体系,不仅通过标准接口透明接入 vLLM、SGLang、TensorRT-LLM 等框架,实现 KV Cache 的透明卸载与共享;而且适配 RoCE、IB、FC 等多种组网模式;还兼容多种主流操作系统,可无缝适配不同计算节点的部署需求。

最后是 " 焕新 ",FN NEO 凸显了智能体时代存算紧密协同的趋势,彻底改变过去存储的被动角色,以 " 共享 KV Cache" 来实现 AI 推理场景的 " 存得下、存得快、存得稳、存得省 "。

综合来看,FN NEO 代表着集中式存储在智能体时代的一次重要演进,它就像一位六边形战士,从硬件架构、性能、可靠性、软件协议等多个层面全面适配 AI 推理需求,通过极致融合能力和极致性价比,一站式满足智能体、模型权重、RAG 等推理全场景的支持;同时,兼具横向与纵向扩展的能力让其具备极高的灵活性,可以灵活满足算力集群规模增大后的需求。

重塑智能体时代的存力锚点

过去十年,存储行业的主旋律是 " 分布式 ",软件定义、弹性扩展、去中心化赋予了存储行业多重想象力;进入到智能体时代,面对动态产生、高频复用、对延迟极度敏感的 KV Cache 数据资产,集中式存储正以一种全新形态演进,与分布式在整个存储产业中继续并驾齐。

在 AI 推理越跑越复杂的今天,新时代存储的 " 求变 " 方向已经清晰:即智能体时代的存力锚点是让 KV Cache 从算力的附庸变成算力效应释放的杠杆。

就像中科曙光 FN NEO,以池化共享能力、关键行业锤炼出的可靠性、极致性能体验和灵活可扩展等 能力,让每一份 KV Cache" 物尽其用 ",为 AI 商业化的大航海带来最为可靠的 " 锚点 "。 

END

文章精选

#

破晓而来!曙光为 AI4S 全面提速

#

全球能耗 Top50 数据中心都有哪些

#

技术破壁 + 硬核突围,曙光登顶 SPC

#

关注!曙光全新超节点即将发布

#

王炸,曙光将高端存储推向新高度

#

数据中心不偏科,算存需协调

#

冷思考:数据中台迷失与前行!

#

深度:生成式 AI 的存储选型建议

#

光子技术:制霸数据中心未来网络

#

群雄逐鹿:高端存储十年史话

大数据在线是聚焦人工智能、大数据、云计算等前沿科技领域深度观察的深度媒体。目前,大数据在线在微信公众号、今日头条号、新浪财经、36 氪、雪球号、观察号等主流自媒体平台均有入驻,积累粉丝超过 20W;并荣获今日头条十大科技新锐媒体、商业新知十大人工智能媒体等多项殊荣。商务联系请添加微信:Owen_Inter,添加请备注具体信息。

>>>

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 人工智能 neo 中科曙光
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论