经济观察报 记者 陈月芹
7 月 17 日至 20 日,在 2026 年世界人工智能大会(WAIC)的 H2 算力馆内,华为、中科曙光、沐曦股份、中兴通讯、东方算芯、燧原科技、百度昆仑芯、新华三、联想集团等企业,纷纷把自己的超节点机柜搬来展示。
一套超节点的造价动辄数亿元,运输难度大。多家算力企业把一整排像墙一样、布满 GPU(图形处理器)的黑色机柜横放在展台门口,正面和背面都敞开让观众查看,以至于入口非常狭窄,观众常常需要侧身挤入。也有企业把超节点柜贴墙摆放,仅开放展示单个计算 " 抽屉 "。
WAIC 现场呈现出了两种参观思路:举着 " 贵宾参观团 " 牌子的一批观众,常常站在超节点机柜前,听工作人员详细讲解;股民、技术极客和带着采购任务的企业人士,则不约而同地绕到机柜后方,研究光模块、线缆、散热方案、交换网板……

超节点机柜前挤满了人(陈月芹 / 摄)
背面更有看头
AI 算力不再只拼单张芯片,而是开始竞争超节点与整机柜方案后,市场的关注点更为具体。
一位国企采购人士告诉经济观察报,去年华为在 WAIC 展出的 Atlas 900 A3 SuperPoD(384 超节点),机柜背面是粗壮的高速铜缆,而今年亮相的新一代 Atlas 950 超节点,用上了 800G 光模块与高密度光纤,大幅减少了传统粗铜缆的使用。在数量上,超节点互联规模也从去年的 384 卡,直接升级至 1024 卡。
华为昇腾此次首次展出的业界最大规模超节点 Atlas 950 SuperPoD 真机,背面还专门挂出长条形的 StarMatrix(华为星联系列)800G LPO 光模块,观众可上手触摸。

华为超节点机柜背面的光模块和线束被围观(陈月芹 / 摄)
超节点机柜的正面,一般是高密度计算单元,形态上是一层层的计算 " 抽屉 " 或刀片服务器,如常见的 8 卡 NPU/GPU 模组化设计,专门负责庞大的矩阵运算与大模型训练和推理。在 WAIC 现场,多数超节点产品开放了部分区域,供观众拉开 " 抽屉 " 观看。
机柜背面的重点则是高速互联、交换网板,供电与配电单元(PDU)以及光模块插槽等,主要负责连接千卡或万卡、解决带宽瓶颈。
超节点不是芯片数量的堆砌。模型参数开始从千亿上升到万亿、训练集群扩张到万卡乃至十万卡量级,企业要比拼的不是单张卡能算多快,而是成千上万张卡能否算到一起。
因此,关注超节点真实效率的行家,想从机柜背面看到各家打通通信瓶颈的解决方案:阿里云磐久 AL128 围绕 AI 训练和推理重构机内互联,为超节点之间预留大规模 Scale-out(横向扩展)带宽;百度智能云自研 XPU-Link 互联协议,中兴通讯发布 OEX 超节点;华为强调灵衢互联,将芯片级、单板级和机柜级通信纳入统一协议。

韩国参观团了解百度昆仑芯的超节点(陈月芹 / 摄)
中科曙光展出的全国产十万卡 AI 超集群曙光 8000(登峰),是 " 算力在沸腾 " 的具象化。这是一套采用浸没相变液冷技术的机柜,把芯片泡在特殊的 " 水 "(电子氟化液)里,芯片工作时发热,液体吸热变成一个个气泡,把热量带走,冷却后再变回液体,循环往复。
一位中科曙光的工作人员介绍,这种电子氟化液约 10 万元 / 吨,会挥发,不够可以补加。中科曙光用了近三年时间,才找到合适的液体,完成从液体配方到整机设计的全链条自研。

中科曙光的超节点会 " 冒泡 "(陈月芹 / 摄)
大模型进化,把压力给到上游
除了超节点,今年 WAIC 的另一个高频词是 Token(词元)工厂。芯片上下游企业不能只卖卡,还需要提供 Token 服务。

摩尔线程展示了 " 词元生产工厂 " 技术细节(陈月芹 / 摄)
一家头部国产 GPU 企业人士向经济观察报解释,传统 GPU 最早是做显卡、擅长图形处理的,如果直接拿来用在大模型上,效果不太好。如果用同一张卡既做 Prefill(编码处理输入),又做 Decode(解码处理输出),是不划算的。因此,这家头部国产 GPU 企业的方案是:用大算力的卡专门处理输入,用小算力但大带宽的卡专门处理输出,使同等成本下的数据处理量实现成倍增长。
月之暗面是这家头部国产 GPU 企业的客户之一。近期 KIMI K3 模型爆火,不少企业在展台询问 KIMI K3 的降本逻辑。该头部国产 GPU 企业人士解释,我们是一个推理芯片的生产工厂,我不关心客户生产的是什么,我在乎的是用最小的成本,让这千张卡一天内能回答更多的问题、提供更多的服务。
大模型、Agent(智能体)能帮人类处理更多复杂任务,也对上游算力企业提出了更高的要求。无问芯穹联合创始人兼 CEO 夏立雪认为,Agent 推理需求上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。
无问芯穹的解决方案是跨集群异构 PD 分离架构,用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来。
这些 Token 工厂及下游大模型企业眼下的重点,不是 " 卷 " 生产单个 Token 有多便宜,而是计算把一个任务办成要花几个字、调几次、错几次,能不能更快、更高效。
企业正在加速扩产。7 月 19 日,中科曙光相关负责人在向广东省委参观团讲解产业链落地情况时透露,中科曙光计划在广州天河区投资建设一个海光产业创新中心,将数千家生态上下游企业聚合,提供设备适配与展示平台,目前已洽谈到第二轮。
将成百上千张卡 " 算到一起 ",一个超节点整机柜群功耗可能高达 400KW(千瓦),单台高密度机柜的功耗在 50KW 以上,这对供电、散热和承重提出了严苛要求。
一家关注柜式节点的采购企业,把两个问题抛给了多家上游企业:一是整体方案能支持多少张卡,想加上更多卡时能怎么互联;二是和英伟达相比,国产 GPU 耗电量等后期成本有多高。他需要计算硬件成本和运维成本的总账。
(作者 陈月芹)
免责声明:本文观点仅代表作者本人,供参考、交流,不构成任何建议。


登录后才可以发布评论哦
打开小程序可以发布评论哦