市场资讯 3小时前
国联民生证券:AI算力向超节点演进 国产产业链迎来发展机遇
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:智通财经)

智通财经 APP 获悉,国联民生证券发布研报称,大模型参数规模向万亿级别演进,驱动 AI 算力需求持续快速增长,超节点正成为 AI 算力基础设施的核心演进方向。当前国内厂商在超节点领域已实现从整机柜级到万卡级统一架构的产品落地,国产算力产业链有望迎来重要发展机遇。建议重点关注:1)国产超节点龙头:浪潮信息 ( 000977.SZ ) 、中科曙光 ( 603019.SH ) 等;2)华为超节点产业链:软通动力 ( 301236.SZ ) 、神州数码 ( 000034.SZ ) 、中国长城 ( 000066.SZ ) 、慧博云通 ( 301316.SZ ) 、拓维信息 ( 002261.SZ ) 等;3)国产 AI 芯片 /CPU:中国长城、寒武纪 ( 688256.SH ) 、海光信息 ( 688041.SH ) 、云天励飞 ( 688343.SH ) 、龙芯中科 ( 688047.SH ) 等。

超节点有望成为万亿参数大模型的重要算力底座

2026 年 5 月,华为在 IEEE ISCAS 2026 上提出韬 ( τ ) 定律:当几何缩微逼近物理极限,半导体系统性能的提升路径从缩小晶体管转向压缩信号传播时延。这一逻辑可类比于超节点在 AI 算力层面的作用:大模型参数规模向万亿级别演进,算力瓶颈已不在单芯片,而在跨节点通信能力。超节点通过跨节点统一内存编址与硬件原生内存语义直访,将通信从软件路径转入硬件路径,使集群规模下算力利用率保持近线性扩展,将大模型算力的扩展重心从单芯片性能转向系统级通信效率,成为万亿级别大模型规模化运行的关键架构方向。

超节点有望成为万亿参数大模型的核心算力底座。传统 " 单芯片迭代 + 服务器横向堆叠 " 的 Scale-Out 扩容路径已现双重瓶颈:一是先进制程演进边际收益递减,单芯片性能提升的成本持续抬升;二是分布式集群节点间地址空间独立,跨节点数据的传输需经过多层软件协议栈处理,通信开销随并行规模扩大呈非线性增长,大量算力在数据等待中被闲置,Scaling Law 延续在架构层面受到约束。通信时延是决定大规模并行效率的核心变量,超节点通过降低跨节点通信的软件开销,实现大规模并行下的近线性性能提升,成为下一代 AI 算力的核心底座。

超节点由多个物理计算节点通过专用高速协议连接,具备跨节点统一内存编址能力,逻辑上呈现 " 单台计算机 " 特征的紧耦合计算系统,核心是为大模型这类紧耦合并行负载提供垂直扩展的算力承载。与传统 Scale-Out 分布式集群相比,超节点从架构层面减小了跨节点通信的软件开销,提升了计算效率。

大模型全流程性能验证:万亿参数大模型的重要底座

大模型自回归推理存在 Prefill(计算密集)与 Decode(内存带宽密集)两种资源需求冲突的阶段,超节点可以成为实现 P/D 分离的重要支撑,因此有望成为下一代 AI 算力架构的核心形态。在 Decode 阶段,决定性能的关键因素不再是 GPU 的峰值算力,而是其在单位时间内能够从显存中读取或写入数据的总量。这一性能直接影响着用户的另一个核心体验指标,即单 Token 生成延迟,它决定了后续文本生成的流畅度,进而 P/D 分离架构应运而生,新型的超节点服务器架构实现高效物理分离,凭借强大的内部互连网络,在内部进行 P/D 任务的划分。同时,在互联协议端,技术的进步可以更有效实现物理带宽能力的释放。以中国移动推动的 OISA 协议为例,新一代互连技术已经超越了单纯 " 数据管道 " 的角色,正在向系统管理中的主动参与者演进。

超节点已在大模型预训练、推理、后训练、多模态等流程中验证出架构价值。根据《超节点定义与实践白皮书》,预训练方面,万亿级参数模型的多卡并行部署带来海量集合通信开销,超节点通过 NPU 间大带宽低时延互联压缩通信开销,在 DeepSeek V3 训练中未掩盖通信比例降低 80%,单 NPU 裸算力提升 2 倍条件下系统训练性能实现 3 倍以上提升。推理方面,万亿参数稀疏化模型需多机大专家并行,每 Token 推理面临高频跨节点小数据通信与长序列 KV Cache 缓存双重挑战,超节点通过 NPU-to-NPU 互联与全局资源池化,能够大幅提升计算效率。

后训练、多模态及 Agentic AI 场景进一步验证了超节点在大模型全生命周期中的架构延展性。后训练方面,强化学习需同时维护策略、价值、奖励及参考四个模型,参数与梯度同步通信量大,传统集群带宽瓶颈致训练效率下降 40%~60%,超节点将模型传输时延从数十秒级降至毫秒级,70B 模型 RLHF 训练中推理时延由数十秒降至秒级。多模态方面,T 级参数模型的多任务负载对通信带宽与异构调度提出更高要求,超节点通过逻辑资源池化与内存语义小包超低时延通信提升分布式推理与 3DGS 重建效率。

超节点发展大势所趋," 模算协同 " 将是中国的伟大机遇

海外:英伟达 NVL72 多代演进,全球超节点的代表性标杆之一

英伟达 NVL72 系列是全球超节点产品的标杆,从 GB200 到 Vera Rubin,持续迭代并将超节点作为核心产品。

国内:重点厂商加速布局,关注 " 模算协同 " 机遇

浪潮信息:元脑 SD200 超节点率先完成 Kimi K2.6、DeepSeek V4、GLM 5.2、MiniMax M3 等主流大模型的高性能优化,在 Kimi K2.6 万亿参数大模型上实现 Token 生成时间 4.77ms,首 Token 延迟降低 35%,为 Agent 场景应用的高效运行提供算力支撑。元脑 SD200 采用多主机低延迟内存语义通信架构,基于开放总线交换技术,在单机内实现 64 路本土 GPU 芯片统一寻址与高速互连,依托百纳秒级低延迟链路降低通信与显存访问开销。

华为:国内超节点核心引领者,万卡级统一架构落地。华为是国内超节点技术的核心引领者,已构建覆盖智算、通算、混合场景的完整超节点产品矩阵,通过自研全栈光互联技术突破万卡级统一架构瓶颈,是国内具备万卡级超节点落地能力的厂商。当前 Atlas 900 超节点已实现规模化部署,后续 Atlas 950/960 将沿规模扩张路径持续迭代,单超节点规模从 384 卡提升至 1.5 万卡级,算力实现百倍级跃升;同时华为将超节点技术延伸至通用计算领域,推出通用计算超节点 TaiShan 950。

中科曙光:无线缆架构创新,单机柜算力密度较高。中科曙光推出的超节点产品聚焦高密度 Scale-Up 纵向聚合,以无线缆正交架构为核心差异化,已形成 X640 与 X40 两大产品形态。

曙光 X640:单机柜级 640 卡超节点千卡级计算单元。采用 " 一拖二 " 高密架构,实现单机柜 640 卡超高速总线互连,构建大规模、高带宽、低时延超节点通信域。双 scaleX640 超节点组成 1,280 卡计算单元,柜间通过高速网络互连。MoE 大模型训练效率与高通量推理吞吐性能提升 30%-40%。采用超高速正交架构,融合超高密度刀片、浸没相变液冷、高压直流供电等多技术创新,单机柜算力密度相比业界其他超节点最大提升 20 倍,PUE 值低至 1.04。基于 AI 计算开放架构设计,适配支持多品牌 AI 加速卡,兼容主流 AI 计算软件生态,适配优化 400+ 主流大模型。

曙光 X40:首个无线缆箱式超节点。面向万亿参数超大语言模型、多模态大模型的训练、微调、离线推理场景,解决传统多机 8 卡集群线缆繁杂、部署周期长、卡间通信瓶颈、运维故障率高的行业痛点。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 华为 产业链 芯片 民生证券
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论