原标题:2026 年下半年,算力竞赛为何突然转向超节点?
" 中国大型互联网企业会在下半年大量部署超节点方案。" 一位算力资深人士告诉数智前线市场的走向。虽然超节点整机价格通常高于同等卡数的普通服务器," 但它的账算得过来,算力密度更高、空间占地更小。现在企业必须在有限空间承载更多算力,超节点是个‘大杀器’。" 新华三人士补充道。
即便此前没有采用超节点的 DeepSeek," 最近也明确要用,正在议价。" 一位云计算大厂人士告诉数智前线,这具有风向标意义。
这一热潮在 2026 世界人工智能大会上表现也很突出。华为展出了 20 个机柜组成的 1024 卡超节点真机、中科曙光展示了沸腾着冷却液的 640 卡超节点,百度天池、阿里云灵骏真武 M890、浪潮信息元脑以及沐曦曦景 S600,都被放在各自展台的突出位置。
什么是超节点?简单来说,它通过高速互联技术,把大量 GPU 或加速卡从 " 多台服务器 " 深度整合成逻辑上像一台 " 超级计算机 " 的系统,解决了传统集群跨机器通信的带宽和延迟瓶颈,从而大幅提升 GPU 或加速卡的利用率,带来单位 Token 成本的下降。" 超节点已成为目前 AI Infra 建设的一个主流趋势。" 华为资深人士对数智前线说。
一年前,超节点还是少数厂商展示系统能力的旗舰产品;一年后,它正在成为主流算力企业必须参与的军备赛。" 国产超节点从去年推出,目前已发展到可批量落地阶段。" 百度昆仑芯人士说," 到今年底,每家算力企业基本上都具备交付能力。"
01、谁在造超节点
超节点不是新概念了。2024 年,英伟达发布 GB200 NVL72,将 72 颗 Blackwell GPU 纳入一个高速互联域,推动该架构进入业界视野,但最初需求并不算旺。到 2025 年,随着大模型参数暴涨,超节点才成为热点。国内厂商也早在 2024 年前后开始做技术预研,最早一批在 2025 年上市,华为、百度智能云、浪潮信息、新华三、中兴等各家都开始发布。超节点赛道开始涌入多个玩家。
但各家争夺的焦点不太一样,目前似乎形成了三条不同路线:一派不断扩大单个超节点的规模,一派更强调部署效率和经济性,还有一派试图用新的芯片和互联架构重新定义超节点。
数智前线观察,其中华为、中科曙光和百度,在走向 " 大节点 "。
华为已向业界展示由 20 个机柜组成的 1024 卡的昇腾 950 超节点真机,并将在今年第四季度批量交付 8192 卡超节点,理论上这是该超节点满配技术上限。华为的判断是,随着大模型参数、上下文长度和推理并发量持续增加,单个计算域需要容纳更多芯片和更大的内存空间。而其去年推出的 384 卡超节点已在互联网、金融、能源、教育和医疗等行业,商用落地 750 多套,证明了超节点的商业规模部署能力。
中科曙光选择了浸没式液冷支撑更高密度部署。单机柜 640 张加速卡,一台冷却设备带两个机柜。由这一超节点构建的十万卡算力集群曙光 8000(登峰),已落地国家超算互联网郑州核心节点。" 目前已跑满了 90%,很多需求来自模型训练,也有 AI for Science。" 曙光人士告诉数智前线。
百度智能云天池超节点则从 256 卡向 512 卡演进,后者将在年底推出。它强调从互联协议、交换芯片到液冷系统的全栈自研。百度智能云混合云部总经理杜海介绍,其超节点已经交付多个万卡集群。文心 5.1 重要版本的训练在全国产集群上完成,能源电力行业支撑 80 多个行业场景推理,也支撑了自研电力大模型的训练。
另一批厂商并不认同 " 越大越好 "。
阿里云推出的灵骏真武 M890,以 64 卡为一个 Scale-up 单元,再通过 Scale-out 网络扩展至更大集群。与多数超节点主要面向私有化部署不同,阿里还将这种算力形态放到公共云上,客户不必采购设备,也可以按需调用。
浪潮信息、沐曦也选择了类似方向。浪潮信息去年推出 64 卡超节点,今年再推 32 卡产品。32 卡可以支撑万亿大模型推理。浪潮信息副总裁赵帅介绍," 我们自己内部用万亿大模型做 AI Coding,效率 * 比用千亿大模型好。这就是万亿参数大模型带来的价值。所以再次推出 32 卡产品,让更多企业真正用得起。" 沐曦则以单柜 64 卡为基础,强调 CUDA 生态兼容和向万卡集群的横向扩展。
还有一些厂商试图跳出英伟达 GPU 或华为加速卡路线,走了第三条路径。清微智能采用可重构数据流架构,每颗芯片同时承担计算和数据转发,芯片之间可直连,无交换机。清微智能产品副总裁陈逸伦告诉数智前线,已推出 4096 卡、峰值算力为 500PFLOPS 的超节点。北京某训练场已部署,内蒙、新疆、浙江的金融行业、国央企也已落地。采用同样路线的还有 7 月产品刚刚上市的东方算芯。
此外,摩尔线程也计划年底伴随新一代 GPU 推出相关产品。寒武纪虽然目前没有超节点,但业界判断下一代芯片也将推出超节点。至此,国内主要算力芯片、服务器企业,几乎都已进入这一赛道。
02、为什么是今年
超节点为什么会在今年爆发?业内认为有三大原因。
*,模型训练和推理需求足够大。训练端,模型参数量在飙升。7 月 Kimi 发布参数达 2.8 万亿的大模型 K3。" 下一个春节,模型参数会变成 3 万亿,再下一个 6 万亿,在后面是 10 万亿。而海外中等规模模型参数量已达 5 万亿。" 沐曦 CTO 杨建博士告诉数智前线。业界通常认为,1 万亿参数模型训练需要约 5000 张卡,3 万亿参数模型大约需要 1 万张卡,6 万亿需要 2 万张卡训练。解决方案 * 是把多个芯片连成一体化去运作。
推理端,华为人士举例,AI Coding 场景中,一个任务触发的操作调用已是几万次,复杂长程任务是几十万甚至上百万次。" 这意味着更多并发、更长上下文,这正是超节点大内存池的核心卖点。" 从训推需求比例来看,阿里云资深人士告诉数智前线,目前线上推理和训练比已接近 5:1~10:1,"1 万张卡里,大约 70%~90% 都在做推理,只有少部分在做训练 "。
第二,账算得过来。超节点的价格比同样卡数服务器总价要贵,但客户算的是总体效能账。" 你不能单看卡的数量,它涉及风火水电基础设施,超节点更集约。为什么大企业都去部署超节点,肯定是算得过来这个账。" 新华三人士告诉数智前线。浪潮信息副总裁赵帅曾举例:" 通过超节点,如果推理性能提升 10 倍,但耗电可能只提升 2 倍,算下来还有收益的。"
昆仑芯人士介绍,传统模式下 10 台机器的算力相加不等于 10," 只能等于 6",超节点通过高速互联把损耗降到 *,让更多算力发挥效能。如用超节点做 PD 分离推理,系统比普通同卡数机器提升 30% 到 50% 的性能。
第三,批量交付节点到了。" 超节点是工程化产物,它包含 GPU 芯片、存储、通信、交换、散热、供电、软件,不是单一厂商能独立搞定的。" 昆仑芯人士说," 目前,超节点已发展到可批量落地阶段了。" 另一位人士补充," 无论性能做得怎么样,大家都可以把整机交付出来 "。

不过,超节点更适合训练还是推理?各家的说法并不同。
华为人士认为,训练、推理都有价值,万亿参数大模型训练需要巨大内存池,Agent 推理需要海量上下文并发,超节点要具备大内存卡。摩尔线程认为,超节点要面向 1 万亿到 5 万亿参数大模型训练,以及高速推理的 tokens 工厂场景。而沐曦人士认为," 经过严密论证,超节点在推理的 Decode 阶段,也就是逐 Token 生成答案时,价值更为突出。" 清微智能陈逸伦分析," 目前超节点在训练侧跑微调较多,拿它做推理性能更好。"
03、分歧与共识
爆火之下,超节点技术路线有诸多分歧,目前还没有标准答案,取决于各企业的技术商业判断。
* 个分歧是规模之争,超节点应该做多大?是 64 卡 /128 卡,还是更大规模?行业分成两个阵营,这里说的是超节点 Scale-up 的规模,就是用高带宽、低时延互联,把多少芯片纳入一个紧耦合计算域。
一些企业人士是 " 小节点派 "。" 在我个人认知里,64 卡就够了。TP 并行、EP 并行的 * 规模可能就是 64 卡,剩下的通过 PP 和 DP 并行、Scale-out 去连起来。你没必要把单个节点的 Scale-up 做到足够大,因为任何通信都有延迟,TP 和 EP 对延迟极度敏感,即便千卡互联中间几个微秒的延迟,GPU 其实都在等。" 一位人士告诉数智前线," 对时延和稳定性都要有考虑,这是一个工程上的平衡,并不是 scale up 越大越好。" 另一位人士持相同立场,"64 到 128 卡是最经济的形态,再大就浪费了。"
另一些企业则是 " 大节点派 ",华为最新超节点扩展至 1024 卡,中科曙光 640 卡,百度天池、新华三均推进至 512 卡。" 进入 Agent 时代后,万亿参数、百万 Token 上下文和海量并发推理下,64/128 卡小节点统一内存池太小 ","64 卡更像基础机柜单元,适合中小规模模型微调、离线推理;万亿大模型完整训练、大规模多智能体并发,必须依靠更大规模超节点 "。
第二个分歧是 CUDA 兼容之争。阿里平头哥、沐曦、海光等走 CUDA 兼容路线,代码迁移成本低。华为昇腾、昆仑芯等走自研生态路线。
一位大厂人士对数智前线分析,自研生态虽然迁移成本高,但可控性和长期演进空间更大。他坦诚,也许两三年后,CUDA 兼容就没有那么重要了。" 我们回归技术 * 性,CUDA 当年的胜出,是很多人做向量编程,心智负担很大,而 CUDA 方案让人在心智上的耗费极大降低,所以在过去 10 多年取得成功。但到今天有了 Agentic coding 后,不一定是人去编程,都走向让 Agent 去干,所以 CUDA 就不那么重要了。"
一位华为人士介绍,华为是国内 * 支持 mxfP8 和 fp4 精度的厂商,mxfP8 的可变量比 fp8 更好。" 有人说昇腾从 CANN 走向了 CUDA,其实并不完全正确。" 他说," 华为增强了向量处理能力,而英伟达增强了矩阵处理能力,两家都走向了‘矩阵和向量综合型’方向。"
还有其他的分歧,如连接中铜缆与光纤,液冷中的风冷和液冷,尤其是浸没式液冷,这些新旧技术转换中,因技术瓶颈、故障率与运维成本产生的矛盾和挑战,让业界有不同的技术商业选择。
一个共识是软硬架构协同。超节点演进与模型技术路线密切相关。国内模型架构如何演进?阿里人士告诉数智前线,国内模型企业 Attention 正在分化为两条路线,其中千问 GDN、Kimi KDA 走向 Linear Attention;DeepSeek 走 Smart Attention(MLA、DSA、CSA),智谱目前也采用 DeepSeek 3.2 的 DSA 架构。两个阵营相对独立,仍需观察未来两三年的演进,这也将影响超节点的硬件适配方向。
浪潮信息董事长彭震最近介绍,过去基础设施主要沿摩尔定律演进,最近的新进展是软硬件联合创新,一端提出新算法,另一端用新介质、硬件和网络适配,收益显著。他看到美国企业也在开展类似探索。
在沐曦杨建博士看来,这条赛道 " 未来二三十年都停不下来 "。今年,他已看到一些企业开始用 AI 参与设计,道路、房屋、机械等设计本质上都属于知识生产,AI 的影响早已超出 coding,正在渗透到各行各业。一位大型企业管理者希望,到 2027 年底实现 " 白天开会写规范,下班前交给大模型,第二天看结果 ",人负责定义和发现问题,大模型负责求解。目前,AI 知识创造的进程," 很多企业还没开始,因为总经理和董事长还没作出对数字员工的定岗决定。" 资深人士观察。这正是 AI 要渗透的市场。
而算力越便宜,行业扩张就越快," 整个链条就再也停不下来了 "。美国算力约为中国的 9 倍。超节点正成为这条产业链向下延伸的重要算力底座。随着更多厂商具备整机交付能力,真正激烈的竞争已经开始。
" 现在比拼的是能否批量交付、稳定运行,并真正降低每 Token 成本。" 一位大厂人士说。供应链是其中更大的挑战," 无论国产还是海外供应都存在不足。锁定供应链,未来发展才更有确定性。"


登录后才可以发布评论哦
打开小程序可以发布评论哦