
作者 | 李水青
编辑 | 心缘
智东西 9 月 17 日上海报道,昨日,华为监事会主席郭平关于 "华为ICT 与计算的目标是成为‘英伟达’ "的内部访谈内容刚刚刷屏,今日,华为就对外放出了憋了一年的算力 " 大招 "。
在刚刚开幕的华为 2026 年全联接大会上,华为灵衢互联架构及超节点集群方案重磅亮相,华为推出了昇腾 960DT 芯片、昇腾 960 超节点、鲲鹏 950 超节点升级、OceanStor M900 记忆存储、灵衢全光交换设备等一系列 AI 基础设施新品。






华为鲲鹏生态全球开发者超过了416 万,支持了 560 多个全球的开源项目;openEuler(开源欧拉)的装机量也超过了2000 万套,成为中国服务器操作系统份额第一。

大模型迈向 10T 级参数规模,超节点是 AI 基础设施建设的必然选择。


华为的超节点设计的理念,是以一套协议平等连接超节点内所有组件,支持跨物理服务器的统一内存编址,并采用近铜远光的这种互联方式,从而使数万颗芯片之间的通信有近乎线性的带宽与时延。它像一台计算机一样工作,能够有效提升 MFU。

这就是华为在去年 HC 大会上推出的灵衢 UnifiedBus,相关技术规范已经全面开放。今天,以灵衢 UnifiedBus 为核心的全新超节点 " 全家桶 " 重磅登场。
二、灵衢一统、11 芯撑起、昇腾 960 面世:华为超节点冲向百万卡
汪涛继续谈道,基于灵衢 UnifiedBus,华为目前已打造了超节点和超节点集群开发 11 颗关键芯片。

在所有芯片中,昇腾芯片是整个系统中的核心部件。



汪涛还现场展示了基于灵衢 UnifiedBus 的超节点集群 11 颗关键芯片,主要包括以下四类:
(1)计算类芯片,包括鲲鹏 CPU、昇腾 NPU,它是关键的计算芯片,承担着最重要的计算功能。
(2)互联类芯片,它不仅有 Scale-out 平面,大容量的交换芯片,更要有 Scale-up 平面的低时延的交换芯片。同时它面向未来跨柜的高速互联,还必须要有能够实现高速光互联的芯片。
(3)存储类的芯片,除大家熟知熟知的介质控制控制器芯片。华为为 AI 的 KV Cache 专门打造了 Smart Storage Unit,以实现平等的一跳直达的缓存系统。
(4)还有各类管理功能的套片,来实现复杂系统中各方面的协调与管理。

2、推出业界首个量产 NPO,昇腾 960 超节点冲上 4096 卡
电互联无法支持跨柜超节点,更大规模的超节点需要光互联技术持续创新。
为此,华为今日宣布推出业界首个量产 NPO(近封装光学)光引擎—— Hi-ONE,以 " 灵衢 UnifiedBus+Hi-ONE" 构建可规模扩展的超节点互联系统。


单个昇腾 960 超节点可实现 4096 卡规模,最大可提供 8 EFLOPS FP8 的算力,实现高达 1PB 的 HBM 容量,系统无故障运行的时间提升 1 倍,系统可用度可以达到 99.8%。昇腾 960 风冷超节点和液冷超节点分别将于 2027 年 Q2 和 Q3 上市。

海量 Agent 并发与交互,需要通算超节点,为此华为鲲鹏超节点全新升级。
随着 Agent 应用的深入,智算系统中 CPU 和 NPU 的计算负荷发生了较大的变化。一方面,多 Agent 交互需要秒级启动、数十万个沙箱,需要毫秒级的沙箱拉起的速度。同时多 Agent 的海量信息检索也需要与之匹配的向量检索性能,单服务器需要数十万的 TPS(每秒事务处理数)。
为此,华为将超节点的架构引入了通算系统,通过超节点的内存统一编制,把多台通用算力的服务器的内存形成一个统一的共享内存池,可以显著提升 Agent 沙箱启动的速度和提升 Agent 向量检索的性能,并提升整个 AI Infer 的资源利用效率。
去年,华为发布了全球首个通算超节点——泰山 950 SuperPoD,很多客户进行了规模部署。今天,鲲鹏超节点将全面升级,基于灵衢,最大支持 4096 节点,形成高达 256TB 的统一内存池。

4、推出 AI 记忆存储方案,KV Cache 时延降超 50%
Agent 与长序列需要多层次 KV Cache 架构,华为基于灵衢打造了 AI 记忆存储 OceanStor M900。



5、灵衢 + 二层 CLOS 组网,华为打造 100 万卡超大规模集群
基于灵衢 UnifiedBus+ 二层 CLOS 灵活组网,华为打造了 100 万卡的超大规模集群。
超节点集群是由多个超节点通过 Scale out 网络交换机互联形成的一个大的集群。昇腾 960 超节点最大规格为 4096 张 NPU 卡,多个 NPU 超节点通过华为的灵衢网络来连接在一起,能构建一个更大规模的超节点集群。
超节点集群支持多种组网模式:一是采用两层 CLOS 单平面组网,华为可以实现 3.2 万张昇腾 960 卡的高效互联。二是采用两层 CLOS 多平面组网,华为最大集群规模可达到 51.2 万张昇腾 960。


(1)以灵衢 UnifiedBus 来统一互联,把多种互联协议统一为灵衢协议,来大幅度减少协议的转换开销。
(2)它将昇腾超节点、鲲鹏超节点以及 KV Cache 等子系统对等互联。
(3)华为能提供多层次高带宽大容量的存储系统,且各类 KV Cache 均可一跳直达,来满足系统中各类热温冷的 KV Cache 需求,最大化来提升整个资源的利用效率。
二、四大举措推进 AI 入端、上车、进家,构筑新一代通信网络
轻量化终端,也会成为智能入口。
过去,传统的终端为用户提供单体功能。未来,AI 将重构终端和人机的关系,围绕人来构建融合的智能空间。人和智能体要相互生,AI 入端正在全面加速。
以手机为例,端侧模型的参数从 2026 年到 2030 年将实现 10 倍的这样的跃迁,从 17B-30B 将很快提升到 70-100B,端侧的算力也有望从 20-80Tops 提升到 180-200Tops。

1、通过 " 麒麟 + 昇腾 " 组合,来实现端侧算力的自给自足。
2、通过 " 盘古 + 三方大模型 " 来实现端侧智能,好用易用。最近,华为在全新发布的华为 Mate X2 非凡大师上,首先商用了原生的盘古 MoE 全国产大模型,参数量为 30B,激活参数为 2B,主打智能、安全、快速。
3、HarmonyOS 不仅是万物互联的操作系统,也将是智能无处不在的 Agent OS,华为将从系统底层架构、运行机制、交互逻辑方面全面重构,来支撑 Agent 和人共生共用。
4、华为丰富的 AI 生态,是小艺系统智能体的枝繁叶茂的基础。
今年 6 月华为开发者大会上,华为发布了鸿蒙智能体框架,将全面开放北向应用和南向设备 AI 接入的能力。
华为将重点围绕智能手机、AI PC、车和家庭场景来打造四大端侧算力平台,通过端端算力的协同和端云算力的协同来,构筑分布式的群体智能,围绕个人移动空间、办公空间、车空间和家空间,提供一体的、连续的智能服务。



三、华为鲲鹏开发者超 416 万,昇腾跨越生态拐点,私有云公有云兼顾
构建开源开放的算力生态,是华为的核心战略。
汪涛宣布,截至目前,华为鲲鹏生态全球开发者超过了 416 万,全球生态合作伙伴超过了 7200 家,支持了 560 多个全球的开源项目。openEuler(欧拉)的装机量也超过了 2000 万套,成为中国服务器操作系统市场份额第一。
同时,华为昇腾已经跨越生态拐点。CANN 已成为中国最活跃的 AI 开源社区,社区月活开发者突破了 5000 多名,外部开发者首次超越了内部开发者,占总开发者数量的 61%;基于昇腾的原生训练模型已超过 40 个。

当前 AI 算力仍处于供不应求的状态,如何提升算力利用率,是 AI 产业发展我们面临的共同的挑战。不同的应用场景、不同的创新模式、不同的智能化阶段,对算力供给的模式提出了多样性的需求。
汪涛称,华为面向千行百业打造硅基黑土地,通过算力基础设施和云服务两种方式,也就是两套核心能力,以灵活的算力供给来满足客户的智能化需求。

从灵衢打破通信墙,到 11 颗芯片撑起超节点,再到百万卡集群与开源生态跨越拐点,华为正以 " 计算 + 通信 " 的垂直整合能力,为 10 万亿级大模型时代构筑算力底座。
当算力供给从 " 卖卡 " 走向 " 卖集群 "、从 " 硬件变现 " 走向 " 生态共赢 ",AI 基础设施的竞争已升维为体系化能力的较量。华为的硅基黑土地,正试图为智能世界提供另一种坚实选择。


登录后才可以发布评论哦
打开小程序可以发布评论哦