雷锋网 昨天
阿里云加速构建Agentic Cloud:推出AgentCore、新一代CPFS等重磅新品
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

9 月 22 日,2026 杭州云栖大会上,阿里云 CTO 李飞飞系统性阐述了 Agentic Cloud 战略布局,阿里云将 Model、Harness、Context 作为核心构建场景,推出全新的云上算力底座和 Agent 构建治理平台 AgentCore、Agent Sandbox、新一代高性能存储 CPFS 等一系列新品,让 AI 真正进入生产流程、走向规模化价值创造。

随着 2026 年 Agent 的爆发式增长,越来越多的智能体正跨过 " 问答型 " 的分水岭,进入自主规划、实时决策阶段,这对算力和云提出了更高的要求。李飞飞认为,企业级 Agent 的大规模落地还需要这些能力:以全面、统一、持续更新的上下文形成全域认知;支持自主运行与持续进化;融入安全、控制、信任和身份认证,实现人与 Agent、Agent 之间的可信协作;从静态规则走向实时感知、动态推理和自主行动。

围绕这四大能力支柱,阿里云重构了从 AI Native Cloud、 Agent Native Cloud 到 Context Engine 的完整技术栈体系。

AI Native Cloud:挑战 RSI 的算力底座

当下模型尺寸正面临从万亿到十万亿参数的跃迁,训练范式也从预训练、后训练 Agentic RL 进一步走向以递归式自我改进 RSI,这要求云底座同时解决超大规模集群稳定性、毫秒级弹性、百万级并发,以及训练、推理和环境交付的统一协同。

阿里云在会上展示了全栈自研的算力底座,覆盖计算、存储、网络等多个产品线,应对 RSI 带来的挑战。以灵骏真武 M890 超节点为例,这是首个国产十万卡超节点集群,有力支撑了 Qwen3.8 Max、KIMI K3 等超 2T 参数大模型对外提供商业服务。即将在明年推出灵骏真武 V900 超节点,性能提升三倍,搭载业界首发 200Pbps 通信带宽,6us 时延集群架构,自研 SNPO 支持全光互联,支持千卡 Scale-Up 互连,单集群可扩展至 50 万卡规模,向广域超节点演进。 

同时,阿里云还推出了新一代全栈自研高性能存储 CPFS,提供高达百 TB/s 级吞吐和亿级 IOPS,单文件系统规模提升 5 倍至 100PiB,支撑大规模模型训练和多模态数据处理。在实际模型训练中,可将模型启动平均耗时降低 50%、峰值算力利用率提升 30%、AI 存储成本降低 69%,使 GPU 从 " 等待数据 " 转向持续高效计算。

推理方面,面对容量激增的 KVCache 和多轮任务的普及,阿里云围绕 Token 生产和缓存调用进行极致的优化,推出大模型 KVCache 管理和调度系统 Tair KVCM,统一编排 Mempool、KVCacheStore 与远端共享存储等多级缓存,存有效命中率可达 99%,每 token 成本下降 50%;推出存储加速引擎 KV CacheStore,位于 G3.5 存储层,承接长上下文、多轮对话和复杂 Agent 任务产生的大量缓存,满足千亿级 KV 存储规模,在客户生产环境下实现缓存覆盖时间窗口扩大 900%,吞吐提升 20%,首 token 延迟降低 54%;全新的智算中心融合网络 TPN,采用 2 层网络设计,访问带宽增加 2.5 倍,网络规模增加 10 倍,延时降低 1/3 ……这些围绕 " 算网存 " 多方协同的技术创新,为模型推理。

此外,人工智能平台 PAI 新增支持异步 AgenticRL 的训练框架,打通轨迹采样、回报累计、模型训练、参数更新的环路。在支持 Qwen 模型后训练的实战中,实现 5 天完成一次 SOTA 模型的后训练。

Agent Native Cloud:支撑 Agent 应用规模化落地

随着 Harness 工程和 skill 的成熟与普及,大模型竞争正从能力比拼转向业务价值兑现——能在真实的生产环境中精细化使用、具备智能组织和智能基础设施、不是概率智能而是可靠的生产力……这些正成为让 Agent 真正融入业务流程必须跨越的门槛。

为了更快让企业级客户与 Harness 深度协同,阿里云推出企业级 Agent 构建治理平台 AgentCore,将企业级 Agent 基础设施标准化、托管化,支持长任务、失败重试、断点恢复和异步执行;提供安全执行环境、资源隔离、身份权限和全链路审计,统一管理模型、MCP Server、Skill 等资产,可提升任务完成率 99%,TCO 成本降低 70%。

此外,阿里云还准备了一系列 Agent 相关产品,为企业级客户提供丰富的选择:包括 Agent Sandbox,为 Agent 提供开箱即用、极致弹性、安全可靠的执行环境,创建吞吐 10 万 / 分钟,深休眠唤醒<600ms,兼容 E2B 和 K8s,满足从开发者到企业级 Agent 的规模化运行需求;Agentic OS,Agent 原生操作系统,可节省 Token 消耗 30% 以上,沙箱部署密度提升 3 倍;Agentic Computer,为智能体提供统一、长期在线的专属云电脑工位,兼容主流 Agent 框架,具备 Computer Use 和 GUI 操作能力,权限可控、操作可审计……

Context Engine:让企业全域数据成为 Agent 的实时上下文

决定 Agent 能力上限的不只是模型参数,还包括能否持续理解企业知识、业务状态和执行反馈,因此上下文不再是应用侧的一段缓存,而正在成为企业需要统一建设和治理的新型数据资产。

  围绕这一变化,阿里云提出了 " 存储—计算处理—上下文工程 " 三位一体的引擎—— Context Engine ,将企业全域数据转化为实时上下文,让 Agent 从 " 知道什么 " 进一步走向 " 此刻应该做什么 ":底层以多模态数据存储承接对话、视频帧、点云、轨迹和 Agent 反馈;中间层覆盖数据集成、转换、治理、质量和建模;上层通过全域知识库、多模态语义整合、持续记忆管理和实时上下文装配,把分散数据组织成 Agent 可以按需调用、动态更新的上下文。

产品层面,Agent Context 面向复杂知识检索,将准确率提升 50 个百分点,Token 使用效率提升 3 倍以上;OpenLake 提供统一全模态数据湖仓,通过一份数据支持多引擎计算,使总体拥有成本降低 38%;Apsara Lakebase 支持亚秒级、零拷贝创建数据分支,为 Agent 提供快速、隔离的数据空间;MC-MaxFrame 以自研分布式计算框架处理多模态数据,计算性能提升 12%;Flink Streaming Agent 提供 60 多种全模态算子,把实时数据流转化为可触发业务流程的实时行动。

从面向 Model 的模型生产,到面向 Harness 的自主运行与持续进化,再到面向 Context 的实时智能决策,阿里云正在把算力、网络、存储、运行环境、身份安全和企业数据组织成统一的 Agentic Cloud。" 阿里云已形成从 AI 芯片、服务器 CPU,到互联、网卡、存储主控和 AI 软件栈的完整布局,可以从计算、网络到存储做全栈协同和联合调优,把智能生产效率做到更高。" 李飞飞表示。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里云 李飞飞 ai 任和 kimi
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论