智东西 昨天
通信墙不破,AI Agent算力不立!华为超节点“黑科技”详解
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 李水青

编辑 | 漠影

智东西 9 月 19 日报道,在 9 月 17 日‑ 19 日举办的华为 2026 年全联接大会上,华为围绕灵衢互联架构及超节点集群,推出昇腾 960 芯片、昇腾 960 超节点、OceanStor M900 AI 记忆存储等一系列 AI 基础设施新品,引起产业多方关注。

其中," 灵衢 " 成为贯穿所有发布、高频出现的关键词,引起了很多人的好奇。

灵衢是什么?有什么过人之处?

华为常务董事、ICT BG CEO 杨超斌在主题为 " 灵衢互联,架构创新,构建 Agentic AI 算力底座 " 的演讲中,给出了完整答案。

简单来说,灵衢(UnifiedBus),是华为整个算力底座的统一互联总线协议。它把 CPU、NPU、DPU、DDR、SSD 等多种计算与存储单元统一互联起来,并进一步贯穿单机、超节点和超大规模集群。

传统互联下,十万卡集群实际算力使用率只有约 20%,难以扛住 AI Agent 时代的计算需求。华为公布的数据显示,基于灵衢的单集群可支持 100 万颗 AI 处理器,10 万卡集群的模型浮点算力利用率(MFU)从20%提升至35%。

为什么华为把这次架构创新的关键点钉在 " 通信 " 上?

这要从 AI Agent 时代的计算需求变化说起。

一、通信成 AI Agent 算力胜负手,三大挑战 " 逼 " 出灵衢架构答案

AI Agent 时代,通信正在成为算力 " 胜负手 "。

现在,模型参数规模已经从万亿级走向 10 万亿级,未来可能进一步达到 20 万亿甚至 50 万亿;上下文长度也从几 K 级来到几 M 级,未来可能达到几十 M。与此同时,人与 Agent 的交互频次也远高于模型。

作为 AI 底层的计算系统,需要同步支持超大模型推理、高频次调用、多种工具使用、多层级信息传递与存储,面临诸多挑战。

1、通信量平方级暴涨,10 万卡 MFU 不足 20%

第一个挑战来自通信范围极速变大。数据并行域内的通信量与参数量呈近似平方关系,不可掩盖的通信时间占比成倍增加,MFU 快速下降。

典型 MoE 模型在 10 万卡集群上的 MFU 不到 20%。如何打破 MFU 随集群规模快速下降的趋势,成为计算系统面临的第一道难关。

2、一种算力喂不饱所有 AI 负载,异构协同与内存池化成刚需

第二个挑战来自 AI 业务负载多样化。Prefill(预填充)与 Decode(解码)呈现出不同的计算特征与访存特征,因此 P、D 分离,用不同算力来满足。

面向未来更大模型、更低时延的推理,Decode 中的 Attention 与 FFN,由于计算与访存特征差异,用专用算力来加速可以提升效率。

同时,随着 Agent 应用普及,CPU 与 NPU 配比发生变化,计算系统需要异构算力协同、内存资源池化,实现动态、高效调整。

3、上下文持续变长,旧互联撑不起多级缓存

第三个挑战是上下文持续变长带来的存储压力。无论是训练还是推理,都必须构建层次化的多级缓存架构,包括 HBM、DDR、SSD 分层分级,成为必然选择。

现有 PCIe 加 RoCE 网络,难以满足缓存所需要的时延与带宽需求。未来 PB 级的 KV Cache,也需要更大的带宽、更低的时延来匹配。

可以说,通信,开始成为计算系统性能的关键。

它需要超强互联能力,支持异构算力高效协同和扩容;也需要打破物理极限,实现算力、内存等资源池化;还需要超大带宽和更低时延,保障计算系统的通信效率。

灵衢,就是华为针对这些变化给出的架构答案。

二、一套协议打通芯片到集群,灵衢四大竞争力重装算力底座

灵衢的核心,是用一套协议贯穿从芯片到集群的整个系统,把复杂协议归一,统一内存语义,消除协议转换开销。

杨超斌谈道,其竞争力可以概括为以下四个维度:

1、协议归一,统一内存语义。传统计算系统采用主从架构,服务器内部 CPU 和内存可以通过 load/store 指令直接访问,但跨节点访问通常依赖 RDMA 的 Send/Receive 消息传递。数据需要反复打包、拆包,还要进行协议转换。

灵衢要做的,就是从协议层重新组织这一过程。华为将 CPU、NPU、DPU、内存、存储、网卡等核心组件统一基于灵衢协议互联,实现十几种协议归一;同时在超节点内部统一内存语义,实现全局内存统一编址。由此,其互联带宽从百 GB 级提升到 TB 级,RTT 通信时延从 7 微秒压缩至 2 微秒,降低约 70%。

2、多样算力,异构协同。CPU、NPU、内存和 SSD 等计算、存储单元通过灵衢直接对等互联,形成去中心化的平等访问方式。这样一来,计算系统可以根据不同业务需求灵活配比 CPU 和 NPU,同时具备可扩展性,而不必受制于固定的节点结构。

3、分级存储,全局池化。随着 AI 模型不断变大,单颗芯片、单台服务器能够提供的内存容量越来越难满足需求。灵衢通过分级存储和全局池化,将多种混合介质纳入统一资源体系,提高内存利用率。

4、光电互联,灵活组网。当超节点从千卡走向万卡,电互联开始受到物理距离、带宽和功耗等限制。华为通过光电互联构建超高带宽、超低时延的 " 数据高速公路 ",让算力能够从柜内向跨柜延伸。

以 4096 卡超节点为例,其需要 56 个计算柜和 14 个灵衢互联柜,灵衢最长传输距离超过 200 米。华为通过光路保护、高速光互联以及 176 端口、280Tb 高速互联的灵衢交换设备,把单个超节点规模从 1024 卡扩展到 4096 卡。

进一步向 Scale-Out 扩展,4096 卡超节点可以作为基本扩展单元,通过 1024 超大 Radix 扇出能力、两层 CLOS 以及多平面、多轨道拓扑,最终让单个集群支持 100 万颗 AI 处理器。

一位产业链人士告诉智东西,过去几年行业多在既有 PCIe 加 RoCE 体系上做优化,但 Agent 负载把通信、内存、存储的短板同时放大,继续在旧协议上叠补丁,收益会越来越小。

灵衢等于给 AI Agent 重装算力底层逻辑,满足多样化算力需求。

三、从单柜到百万卡,从超节点到一体机,满足各类 Agent 需求

基于灵衢,华为进一步构建了一套光电互联、多样算力、分级池化的 AI Agent 超节点集群。计算、存储、联接产品全面支持灵衢,模块化设计,灵活配置。

1、支撑超节点 " 全家桶 ",昇腾 960 提前登场,狂卷计算效率

会上新发布的 Agentic AI 超节点集群由鲲鹏 950 超节点、昇腾 960 超节点、OceanStor M900 记忆存储、星河 UBG 交换机组成。整个超节点集群,可以实现灵衢统一协议、多样化算力灵活扩展、资源分级池化,让计算效率最优。

其中,基于灵衢 +NPO 光引擎 Hi-ONE,单个昇腾 960 超节点可实现 4096 卡规模,最大可提供 8 EFLOPS FP8 的算力,实现高达 1PB 的 HBM 容量,系统无故障运行的时间提升 1 倍,系统可用度可以达到 99.8%。昇腾 960 风冷超节点和液冷超节点分别将于 2027 年 Q2 和 Q3 上市。

2、从单柜 172T 到百万卡:灵衢一统,分层按需弹性扩展

在 Scale-Up 方向,柜内灵衢交换刀片支持 172T 超大带宽,可实现 72 个昇腾处理器和 18 个鲲鹏处理器互联。华为还通过光互联减少柜内电缆,一个 4096 超节点内单柜可节省 196 公里铜缆,超过上海到杭州的距离。

跨柜后,灵衢交换设备拥有 176 个端口,每个端口达到 1.6T,单机实现 280T 全光互联。两层 CLOS 组网可以构建 4096 卡超节点,RTT 时延低至 2 微秒。

再向 Scale-Out 扩展,UBG 灵衢网络交换机拥有 1024 超大 Radix 扇出能力,可支持百万卡超节点集群,支持模型参数向几十万亿演进。

由此,灵衢形成了一套从单柜、千卡、万卡到百万卡的分层分级互联体系,并能够按需弹性扩展。

3、算力存储三件套,灵衢融合出 1+1+1>3

再看算力与存储,鲲鹏 950 超节点的计算刀片提供 384 个 CPU 核和 6TB 内存。单柜可提供 12288 个 CPU 核,支持 192TB 内存。基于灵衢,鲲鹏超节点可以实现超过 150 万核统一调度,以及 24000TB 内存全局池化、统一编址和统一访问。

昇腾 960 超节点计算刀片则支持 8 颗昇腾 960 NPU,提供 32 PFLOPS FP4 算力、4.5TB 统一内存,以及 17.9TB/s 灵衢互联带宽。

OceanStor M900 则负责记忆存储。它通过全新的存储控制器和 ASU 模组,实现网络、CPU、盘控芯片 " 三芯合一 ",单 ASU 模组拥有 64TB 容量密度,单节点访问带宽达到 480GB/s。

三类硬件通过灵衢统一协议进行灵活配置,实现联动协同和全局访问。华为将这种融合效果概括为 "1+1+1>3"。

4、灵衢下沉一体机:Atlas 650E 双机直连,本地跑万亿模型

而在更大规模集群之外,中小场景同样在灵衢覆盖范围内。

大部分企业实际部署仍然需要风冷和轻量化方案,桌面级 AI 应用也在快速普及。因此,华为基于灵衢推出从 1 卡到 8 卡的系列化、多层级一体机产品和鲲鹏昇腾模组。

Atlas 650E 可以通过双机灵衢直连,让 16 个 NPU 进行 Full-Mesh 组网,无需交换机。两台机器可以像一台一样运行,支持万亿参数模型,并通过 EP16 并行切分让推理吞吐提升 40% 以上,时延低至 10 毫秒,让中小企业也能在本地运行万亿参数大模型,同时保障用户体验和数据安全。

未来增加到 16 卡以上,其还可以继续通过灵衢互联进行平滑扩容,形成小型超节点,同时支持 PD 分离部署,实现异构 AI 算力的高效协同。

总的来说,大场景有百万卡集群,中小场景有一体机,华为要把 " 灵活算力 " 打成产业刚需。

四、开源组件加行业算子库,让生态伙伴 " 开箱即用 "

灵衢要成为底座,不能只靠硬件。

杨超斌在演讲中回顾,去年 8 月 5 日,华为 CANN 全面开源开放,至今已跃升为中国开源项目活跃度第一。

目前 CANN 社区月活开发者已经达到 5200 多人,来自企业、高校等不同群体的开发者持续参与。50 多家行业头部客户、伙伴及高校科研团队与昇腾合作,将行业知识和业务经验融入昇腾,已经打造 26 个行业专属算子库。

华为与南方电网、高校及其他伙伴一起,在社区中构建起电力仿真求解、电力负荷预测、电力装备巡检等一系列专属开源算子库,让输电线路巡检更加精准,让电网负荷预测更加高效,真正让 AI 落地到电力生产一线。

科大讯飞深耕 AI 大模型与应用技术创新,基于昇腾打造领先 AI 模型,开发了智能客服、办公等通用方案,金融、教育、医疗等行业场景化方案,为客户提供高质量 AI 解决方案。

另一侧,则是 Agent 开发生态。华为正在与 DeepSeek Harness、OpenCode、openJiuwen 等开源框架协同,打造智能管理系统、推理加速库、安全框架等 Agent 插件化组件,并进行全量开源。

为了进一步降低开发和部署门槛,华为还与 90 多家主流开源社区展开合作,覆盖算子编程、基础库搭建、模型训练微调、推理部署和强化学习等全链路场景。

可以看到,华为希望最终实现的,是 " 开箱即用 "。这也是所谓 " 硅基黑土地 " 战略的核心逻辑。

结语:算力底座之争,华为给出 " 系统级加开放生态 " 新选择

AI 时代奔涌而来,算力是这场变革的核心基石。杨超斌在演讲结尾表示,未来华为将坚持系统级技术创新,面向各行各业,构筑系列化算力底座;坚持开源开放、联合客户、伙伴和开发者,共建生态,为世界提供新的选择。

从灵衢打破通信墙,到 11 颗关键芯片撑起超节点,再到百万卡集群与开源生态跨越拐点,华为正以 " 计算加通信 " 的垂直整合能力,为 10 万亿级大模型时代构筑算力底座。

当算力供给从 " 硬件变现 " 走向 " 生态共赢 ",AI 基础设施竞争已升维为体系化能力较量。华为的硅基黑土地,正试图为智能世界提供另一种坚实选择。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 华为 智东西 杨超 ssd
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论