智东西 昨天
刚刚,华为昇腾960超节点提前登场!韬定律立功性能翻倍,剑指英伟达
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 李水青

编辑 | 心缘

智东西 9 月 17 日上海报道,昨日,华为监事会主席郭平关于 "华为ICT 与计算目标是成为‘英伟达’ "的内部访谈内容刚刚刷屏,今日,华为就对外放出了憋了一年的算力 " 大招 "。

在刚刚开幕的华为 2026 年全联接大会上,华为灵衢互联架构及超节点集群方案重磅亮相,华为推出了昇腾 960DT 芯片、昇腾 960 超节点、鲲鹏 950 超节点升级、OceanStor M900 记忆存储、灵衢全光交换设备等一系列 AI 基础设施新品。

华为副董事长、轮值董事长汪涛现场宣布,昇腾 960DT芯片将提前就绪。该芯片支持 2 PFLOPS(FP8)、4 PFLOPS(FP4)算力,相比上代实现翻倍性能。汪涛称,该芯片目前研发超预期,预计2027 年一季度将就绪。

华为昇腾系列芯片的提前就绪离不开韬定律。依托这一 " 时间缩微 " 替代 的创新方向,华为昇腾系列芯片将继续坚持一年一代的演进节奏。在 2028 年和 2029 年,华为将陆续推出昇腾 970 和 980芯片,来实现算力性能继续翻倍

汪涛还透露,华为昇腾 910C超节点已部署超过 1000 套,昇腾 950 超节点已经开始规模商用。

本次发布的更深层焦点——灵衢 UnifiedBus,是华为整个算力底座的统一互联总线协议。华为常务董事、ICT BG CEO 杨超斌在演讲中提到,基于灵衢 UnifiedBus 的单集群可支持100 万颗AI 处理器,10 万卡集群的模型浮点算力利用率(MFU)从20% 提升至 35%。

汪涛谈道:"AI 变革的速度超过历史上任何一次技术革命,智能世界正加速到来。"强大的 AI 基础设施是智能世界的坚实底座,为此华为坚持聚焦打造智能世界的硅基黑土地,包括 "AI 战略的核心是算力,坚持硬件变现"、"超节点 + 集群,打造中国坚实算力底座 " 等七大战略

生态方面,汪涛宣布华为昇腾已经跨越生态拐点,CANN 社区月活开发者突破 5000 多名,外部开发者首次超越了内部开发者,占总开发者数量的 61%。

华为鲲鹏生态全球开发者超过了416 万,支持了 560 多个全球的开源项目;openEuler(开源欧拉)的装机量也超过了2000 万套,成为中国服务器操作系统份额第一。

一、打破 10 万卡集群通信墙,华为憋了一年的大招来了

大模型迈向 10T 级参数规模,超节点是 AI 基础设施建设的必然选择。

汪涛认为,10 万卡算力集群即将成为训练 SOTA 模型的标准配置,但也面临巨大挑战:大规模跨节点通信开销巨大,导致 MFU(模型浮点算力利用率)提升困难,集群整体有效算力远低于卡数简单相加的理论值。

因此,围绕减少通信占比来优化计算系统架构,是构建一套高效率的 AI 基础设施的合理技术选择。

华为的超节点设计的理念,是以一套协议平等连接超节点内所有组件,支持跨物理服务器的统一内存编址,并采用近铜远光的这种互联方式,从而使数万颗芯片之间的通信有近乎线性的带宽与时延。它像一台计算机一样工作,能够有效提升 MFU。

为了打造这套复杂的系统,首先要有能够平等连接集群内所有组件的互联协议。

这就是华为在去年 HC 大会上推出的灵衢 UnifiedBus,相关技术规范已经全面开放。今天,以灵衢 UnifiedBus 为核心的全新超节点 " 全家桶 " 重磅登场。

二、灵衢一统、11 芯撑起、昇腾 960 面世:华为超节点冲向百万卡

汪涛继续谈道,基于灵衢 UnifiedBus,华为目前已打造了超节点和超节点集群开发 11 颗关键芯片。

1、11 颗芯片撑起超节点,昇腾 960DT 来了

在所有芯片中,昇腾芯片是整个系统中的核心部件。

汪涛现场宣布推出昇腾 960DT 芯片。该芯片支持 2 PFLOPS(FP8)、4 PFLOPS(FP4)算力,片上 HBM 最大可支持 288GB,带宽可以支持到 9.6TB 每秒,能实现翻倍性能。该芯片目前研发超预期,比原计划目标提前三季度,预计 2027 年一季度将就绪。

昇腾 960PR 将进一步支持 8 PFLOPS 的 FP4 算力,比原计划提前一季度,预计 2027 年的三季度可以准备就绪。

未来,华为昇腾系列芯片将继续坚持一年一代的演进节奏。在 2028 年和 2029 年,华为将陆续推出昇腾 970 和 980 芯片,依托韬定律的创新方向来实现算力规格继续翻倍,仿真带宽、仿真容量、互联带宽等也会大幅提升。

汪涛还现场展示了基于灵衢 UnifiedBus 的超节点集群 11 颗关键芯片,主要包括以下四类:

(1)计算类芯片,包括鲲鹏 CPU、昇腾 NPU,它是关键的计算芯片,承担着最重要的计算功能。

(2)互联类芯片,它不仅有 Scale-out 平面,大容量的交换芯片,更要有 Scale-up 平面的低时延的交换芯片。同时它面向未来跨柜的高速互联,还必须要有能够实现高速光互联的芯片。

(3)存储类的芯片,除大家熟知熟知的介质控制控制器芯片。华为为 AI 的 KV Cache 专门打造了 Smart Storage Unit,以实现平等的一跳直达的缓存系统。

(4)还有各类管理功能的套片,来实现复杂系统中各方面的协调与管理。

汪涛称,正是有了这 11 颗关键芯片,华为才能够为 AI 打造更有竞争力的超节点和集群。

2、推出业界首个量产 NPO,昇腾 960 超节点冲上 4096 卡

电互联无法支持跨柜超节点,更大规模的超节点需要光互联技术持续创新。

为此,华为今日宣布推出业界首个量产 NPO(近封装光学)光引擎—— Hi-ONE,以 " 灵衢 UnifiedBus+Hi-ONE" 构建可规模扩展的超节点互联系统。

汪涛宣布,全球首个 7.2Tbps NPO 光引擎 Hi-ONE 实现规模量产,这是业界首个量产的 NPO 产品,是目前行业最大传输能力的 NPO 产品,也是唯一实现内置光源的 NPO 产品,它能把高带宽、高可靠、低时延和低功耗完美的融为一体。

今日,华为还正式推出业界首个采用 NPO 的超节点——昇腾 960 超节点。

单个昇腾 960 超节点可实现 4096 卡规模,最大可提供 8 EFLOPS FP8 的算力,实现高达 1PB 的 HBM 容量,系统无故障运行的时间提升 1 倍,系统可用度可以达到 99.8%。昇腾 960 风冷超节点和液冷超节点分别将于 2027 年 Q2 和 Q3 上市。

3、鲲鹏超节点:4096 节点、256TB 统一内存池,Agent 启动快 30 倍

海量 Agent 并发与交互,需要通算超节点,为此华为鲲鹏超节点全新升级。

随着 Agent 应用的深入,智算系统中 CPU 和 NPU 的计算负荷发生了较大的变化。一方面,多 Agent 交互需要秒级启动、数十万个沙箱,需要毫秒级的沙箱拉起的速度。同时多 Agent 的海量信息检索也需要与之匹配的向量检索性能,单服务器需要数十万的 TPS(每秒事务处理数)。

为此,华为将超节点的架构引入了通算系统,通过超节点的内存统一编制,把多台通用算力的服务器的内存形成一个统一的共享内存池,可以显著提升 Agent 沙箱启动的速度和提升 Agent 向量检索的性能,并提升整个 AI Infer 的资源利用效率。

去年,华为发布了全球首个通算超节点——泰山 950 SuperPoD,很多客户进行了规模部署。今天,鲲鹏超节点将全面升级,基于灵衢,最大支持 4096 节点,形成高达 256TB 的统一内存池。

鲲鹏超节点可显著加速 Agent 的性能。10 万级别的沙箱启动,相比传统服务器方案提升 30 倍,沙箱密度进一步提升 25%;在复杂的向量检索场景下,实现检索效率比传统服务器性能倍增,达到 30 万 TPS。

4、推出 AI 记忆存储方案,KV Cache 时延降超 50%

Agent 与长序列需要多层次 KV Cache 架构,华为基于灵衢打造了 AI 记忆存储 OceanStor M900。

华为 OceanStor M900 搭载灵衢 UnifiedBus 总线,支持直连华为 L3.5 层的 PB 级 KV Cache 解决方案。业界通常采用是 PCIe 加 RoCE 互联的 L3.5 层的存储系统,其 GPU 或 NPU 访问 SSD 池需要 5 次数据搬运,华为的 OceanStor M900 只需要 1 次数据搬运,I/O 时延和首 token 时延可降低超过 50%。

同时华为的 OceanStor M900 可将 SSD 的读写寿命提升 16 倍,从底层来保障 KV Cache 的高命中率和常温可靠。

OceanStor M900 液冷节点

5、灵衢 + 二层 CLOS 组网,华为打造 100 万卡超大规模集群

基于灵衢 UnifiedBus+ 二层 CLOS 灵活组网,华为打造了 100 万卡的超大规模集群。

超节点集群是由多个超节点通过 Scale out 网络交换机互联形成的一个大的集群。昇腾 960 超节点最大规格为 4096 张 NPU 卡,多个 NPU 超节点通过华为的灵衢网络来连接在一起,能构建一个更大规模的超节点集群。

超节点集群支持多种组网模式:一是采用两层 CLOS 单平面组网,华为可以实现 3.2 万张昇腾 960 卡的高效互联。二是采用两层 CLOS 多平面组网,华为最大集群规模可达到 51.2 万张昇腾 960。

华为要发挥 " 计算 + 通信 " 综合优势,打造 Agentic 时代的超节点集群,加速 10 万亿大模型训练和推理。

这样的超节点集群具备三大特征:

(1)以灵衢 UnifiedBus 来统一互联,把多种互联协议统一为灵衢协议,来大幅度减少协议的转换开销。

(2)它将昇腾超节点、鲲鹏超节点以及 KV Cache 等子系统对等互联。

(3)华为能提供多层次高带宽大容量的存储系统,且各类 KV Cache 均可一跳直达,来满足系统中各类热温冷的 KV Cache 需求,最大化来提升整个资源的利用效率。

二、四大举措推进 AI 入端、上车、进家,构筑新一代通信网络

轻量化终端,也会成为智能入口。

过去,传统的终端为用户提供单体功能。未来,AI 将重构终端和人机的关系,围绕人来构建融合的智能空间。人和智能体要相互生,AI 入端正在全面加速。

以手机为例,端侧模型的参数从 2026 年到 2030 年将实现 10 倍的这样的跃迁,从 17B-30B 将很快提升到 70-100B,端侧的算力也有望从 20-80Tops 提升到 180-200Tops。

华为将从四个方面来构建能力:

1、通过 " 麒麟 + 昇腾 " 组合,来实现端侧算力的自给自足。

2、通过 " 盘古 + 三方大模型 " 来实现端侧智能,好用易用。最近,华为在全新发布的华为 Mate X2 非凡大师上,首先商用了原生的盘古 MoE 全国产大模型,参数量为 30B,激活参数为 2B,主打智能、安全、快速。

3、HarmonyOS 不仅是万物互联的操作系统,也将是智能无处不在的 Agent OS,华为将从系统底层架构、运行机制、交互逻辑方面全面重构,来支撑 Agent 和人共生共用。

4、华为丰富的 AI 生态,是小艺系统智能体的枝繁叶茂的基础。

今年 6 月华为开发者大会上,华为发布了鸿蒙智能体框架,将全面开放北向应用和南向设备 AI 接入的能力。

华为将重点围绕智能手机、AI PC、车和家庭场景来打造四大端侧算力平台,通过端端算力的协同和端云算力的协同来,构筑分布式的群体智能,围绕个人移动空间、办公空间、车空间和家空间,提供一体的、连续的智能服务。

物联生态方面,开源鸿蒙生态规模已经超过 13 亿。汪涛称,AI Coding 大幅提升了华为终端的开发效率,轻智能终端的时代已经来临。

围绕 " 用算 ",汪涛最后还提出构筑新一代通信网络,将算力连接在一起,最终形成硅基黑土地。

他提到。AI 时代的通信网络将围绕运算,以及 5G 或 6G、万兆光网等新兴通讯技术,从中心到边缘、再到终端,面向不同用户按需提供网络的连接能力,保障智能触达每一个人、家庭和企业。

三、华为鲲鹏开发者超 416 万,昇腾跨越生态拐点,私有云公有云兼顾

构建开源开放的算力生态,是华为的核心战略。

汪涛宣布,截至目前,华为鲲鹏生态全球开发者超过了 416 万,全球生态合作伙伴超过了 7200 家,支持了 560 多个全球的开源项目。openEuler(欧拉)的装机量也超过了 2000 万套,成为中国服务器操作系统市场份额第一。

同时,华为昇腾已经跨越生态拐点。CANN 已成为中国最活跃的 AI 开源社区,社区月活开发者突破了 5000 多名,外部开发者首次超越了内部开发者,占总开发者数量的 61%;基于昇腾的原生训练模型已超过 40 个。

其生态已经覆盖了 90 多个主流的三方社区,如 PyTorch、Triton、vLLM、VRR 等,在 Linux 基金会的大力支持下,昇腾已经成为继英伟达、AMD 和英特尔之后,在 PyTorch 官网上可以直接安装的算力平台。

当前 AI 算力仍处于供不应求的状态,如何提升算力利用率,是 AI 产业发展我们面临的共同的挑战。不同的应用场景、不同的创新模式、不同的智能化阶段,对算力供给的模式提出了多样性的需求。

汪涛称,华为面向千行百业打造硅基黑土地,通过算力基础设施和云服务两种方式,也就是两套核心能力,以灵活的算力供给来满足客户的智能化需求。

结语:灵衢破墙,华为要重做 Agent 时代的算力底座

从灵衢打破通信墙,到 11 颗芯片撑起超节点,再到百万卡集群与开源生态跨越拐点,华为正以 " 计算 + 通信 " 的垂直整合能力,为 10 万亿级大模型时代构筑算力底座。

当算力供给从 " 卖卡 " 走向 " 卖集群 "、从 " 硬件变现 " 走向 " 生态共赢 ",AI 基础设施的竞争已升维为体系化能力的较量。华为的硅基黑土地,正试图为智能世界提供另一种坚实选择。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

华为 芯片 ai 汪涛 英伟达
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论