热点科技 11小时前
逛完WAIC才明白,国产算力不跟英伟达比单卡了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

据 SemiAnalysis 测算,单颗国产 AI 芯片的性能,大约是英伟达 Blackwell 架构的三分之一。

这是国产算力在先进制程受限下面对的物理天花板。但在 WAIC2026 上,一条绕开这块天花板的路线被跑通。当芯算融合馆挤满专业观众时,很多人是来看这套新解法的。

" 拼积木 " 的系统战

既然单卡存在差距,那就把卡连起来。这种把几百上千颗芯片组合成一台 " 超级计算机 " 的技术,业内叫超节点。

华为之前算过一笔账。单颗昇腾芯片确实有差距,可一旦用高速互联技术把它们组成 CloudMatrix 384 集群,总体性能是英伟达 GB200 NVL72 的 1.7 倍,内存容量达到 3.6 倍。这种方案弥补了单点性能短板,在整体吞吐量上实现了反超。

这次在 WAIC 现场,华为把 Atlas 950 超节点真机拉了过来。这个庞然大物单机柜装了 64 张卡,靠着自研的灵衢协议,能把 1024 张卡连在一起。它实现了 256TB 的全局统一内存编址。大模型训练中芯片之间数据交互频繁,现在所有芯片访问远端数据就像访问本地缓存一样快,通信时延压到了 3 微秒。昇腾上一代超节点已在 20 多个行业落地 750 多套,这种从技术可行到商业可用的跨越,给行业留下了实际的参考样本。

  不只是华为在做这件事。中科曙光宣布了国内首个全国产十万卡 AI 超集群 " 曙光 8000" 投入使用。这套系统以海光芯片为算力底座,采用 " 超智融合 " 技术路线,同时支持高精度科学计算和低精度智能计算。十万张卡的规模,对系统可靠性要求极高,任何一个部件抖动都可能导致整体作废。中科曙光给出的解法,是算力单元与机柜解耦,单节点集成 40 张 GPU,部署周期从数月缩短到了数小时。

中兴通讯在展会上发布了 OEX 超节点。他们的思路是开放解耦,底层协议标准化,全面兼容壁仞、沐曦、燧原等国内多元 GPU 生态。客户可以自主选择最优的芯片组合,再通过中兴的大容量交换芯片打通机内与机间互联。为了解决散热问题,这套方案配套了全栈液冷技术,能把 PUE 控制在 1.15 以内。

清微智能也在展示他们的 REX81 Supernode 系统。这套系统集成了 4096 颗 TX81 芯片,算力突破每秒 500 千万亿次。清微智能 CTO 欧阳鹏的解释很直白:超节点就是把众多芯片紧耦合在一起,像一个单一节点一样工作。通过芯片直连通道,这套方案减少了传统集群中的交换节点,互联成本降幅约 90%。

超节点扎堆出现,不是巧合。大家等于承认了一件事:制程上那点差距,短期追不上,那就换个地方比。

被低估的生态软板

行业里衡量这件事有个硬指标,叫 MFU,模型算力利用率。芯片标称算力再高,真正能用在训练上的只是一部分。有科技公司基础设施负责人算过一笔账,极端情况下,模型训练过程中会浪费掉一半算力。而决定这个指标高低的,很大程度上不是芯片本身,是底层驱动、算子库和并行策略这些软件层的功夫。

国产阵营在这上面已经交出过一份答卷。华为用 8192 枚昇腾 910 训练盘古大模型时,MFU 超过了 50%,而训练同类稠密模型的业内普遍基准通常在 40% 到 50% 之间。但单点案例不等于普遍水平。CUDA 生态覆盖了绝大多数开发者,开发者设计新算子,第一时间适配的还是英伟达的卡。如果国产软件栈跟不上主流开源框架的更新节奏,客户手里的卡就跑不起来新模型。

所以今年 WAIC 上,算力厂商开始在软件适配上发力。清微智能的 RAISA 软件栈已经适配了 200 多个大模型,支持 PyTorch 等主流框架和 CUDA 算子迁移。华为的昇腾 CANN 也在全面开源开放,旨在降低开发者的迁移门槛。沐曦股份带着全精度 GPGPU 架构和 MXMACA 软件栈亮相,尝试建立完整的软件生态。

芯片发布只是第一步,让开发者用得顺手,才是决定产品能否存活的关键。

推理时代的门票

算力基础设施的这波重构,背后是一本经济账。

IDC 中国上个月表示,到 2027 年,推理会占到智能算力需求的七成以上。这个数字意味着什么?前几年买卡主要是为了训模型,训完一轮算一轮。推理不一样,模型只训几次,推理却要发生亿万次,智能体一个任务还会连续触发好几轮模型调用。到了这一步,客户关心的就不再是峰值算力,而是并发撑不撑得住、响应快不快、每个 Token 的成本能不能压下来。

而推理恰恰最吃通信时延和互联带宽,这两样都是超节点的长处。卖方市场已经有了反应。华泰证券在研报中,把超节点称作 "26 年国产算力破局之道 ",测算出的 2028 年市场规模是 3414 亿元。订单也来得比预想的快。中国移动今年 3 月启动了集团层面首次 AI 超节点集采,6208 张加速卡,运营商里这是头一回。

采购方的口味也跟着变了。前几年客户拿着单卡参数表挑货,现在直接问:能不能把我的模型跑起来,后续扩容怎么办。这道题单靠芯片答不了,互联协议、整机柜、散热、软件栈,哪一环短了都交不出货。逛完这届 WAIC 再回头看,单颗芯片三分之一的差距还在那里,但行业已经不在这个刻度上纠缠了。胜负手换成了另一个:谁能把一整套系统稳定地交到客户机房里。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 华为 中科曙光 芯片 gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论