8 月 28 日,2026 中国国际大数据产业博览会期间,中科曙光发布新一代词元加速方案 ParaCache。该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。测试显示,在约 12 万词元输入下,ParaCache 可使模型开始回答前的等待时间最高降低 98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的 27 倍。

▍少做重复计算,让算过的直接复用
随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。
ParaCache 的思路很直接:把已经算过的结果长时间保存下来,下次需要时直接复用。
该方案统一管理 GPU 显存、CPU 内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现 " 一次计算、多次使用 "。
ParaCache 以曙光分布式存储 ParaStor 为基础,并融合集中式全闪存储 FlashNexus,将存储能力从保存原始数据进一步延伸至保存和复用大模型计算结果,在减少重复计算的同时,降低对高成本显存的占用。

▍ " 多快好省 ",推理效率全面提升
ParaCache 带来的价值,可以概括为 " 多、快、好、省 "。
" 多 ":高并发场景下,系统每秒处理的词元量最高达到原来的 27 倍,同样的硬件资源能够承接更多业务请求。
" 快 ":输入约 12 万词元时,单轮对话开始回答前的等待时间可降至 0.4 秒;连续 20 轮对话中,这一时间由 43.1 秒降至 4.9 秒。
" 好 ":兼容主流推理框架和国产 AI 加速卡,可在现有系统基础上接入,降低部署和迁移成本。
" 省 ":高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。
目前,ParaCache 已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低 50% 以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。
同时,ParaCache 已在全国产十万卡 AI 超集群曙光 8000 上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。
中科曙光分布式存储产品部总经理石静表示,ParaCache 不是简单提升单张 GPU 的性能,而是通过减少重复计算,把更多算力用于处理新的任务。
过去,存储主要负责保存数据。ParaCache 进一步将模型已经完成的计算结果纳入存储和复用体系。对于大模型推理而言,少一次重复计算,就意味着少一段等待,也少一份算力消耗。
围绕本届数博会 " 词元——数据要素价值释放新路径 " 主题,ParaCache 提供了一条更具体的技术路径:不仅保存数据,也保存数据在计算过程中产生的结果,让一次计算形成的价值被持续复用。


登录后才可以发布评论哦
打开小程序可以发布评论哦