雷锋网 昨天
国产首个十万卡集群曙光8000亮相WAIC,上线首周应用满载
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

" 如果全部算力都用于推理,曙光 8000 将是中国最大的 Token 工厂,能支撑当前全国 5%~10% 的 Token 需求。" 在一次采访中,中科曙光公司高级副总裁李斌的换算,让现场嘉宾对国产十万卡集群的体量有了最直观的感受。

7 月,光合组织 2026 智能计算应用大会期间,首台全国产十万卡量级 AI 超集群系统——曙光 8000(登峰)正式落成,一周后真机在世界人工智能大会(WAIC)正式亮相。据了解,这也是国内首台明确采用 " 超智融合 " 技术路线的系统。

根据曙光 8000(登峰)公布的最新运行数据,集群正式上线市场需求火爆,首周即实现应用满载运行,目前日均处理作业数突破 15 万个,单日处理作业峰值超过 50 万个。

落成即投用,投用即满载。从万亿级参数大模型的训练和高通量推理,到超 300 余个重点科学工程计算应用,再到 AI4S(AI for Science)的前沿探索,曙光 8000 承担的任务量被迅速拉满的同时,还为下一代十万亿参数大模型预留了空间。

但挑战随之而来。当建设成本与运营复杂度呈指数级攀升,这套在 2024 年底完成研制并在接下来一年多时间内完成批量部署的系统,究竟如何撑起十万卡的野心?

十万卡集群的工程硬仗

故事的开端并不在 AI。

早期大规模 GPU 集群主要服务于模拟仿真、流体力学等高性能计算场景。转折出现在 2018 年。英伟达发布的 HGX-2 统一计算平台,不仅验证了大规模 GPU 互连的可行性,更值得注意的是,其搭载的 V100 凭借 Tensor Core,首次将 AI 混合精度计算能力推至百 TFLOPS 级别。

同年公布的全球超算 TOP500 榜单显示,Tensor Core GPU 已广泛进入超级计算机系统。这意味着,原本主要服务于科学计算的基础设施,开始具备支撑大规模 AI 训练的能力。

但真正推动 AI 基础设施扩张的是 AI 训练需求的爆发。彼时 OpenAI 披露了一组数据:自 2012 年 AlexNet 点燃深度学习热潮以来,用于最大规模 AI 训练的算力增长了超 30 万倍。OpenAI 同时预警:业界必须为 " 远超当前算力水平的全新系统 " 做好准备。

大模型时代迅速验证了上述判断。模型参数、训练数据和推理需求的膨胀,对总算力不断提出更高要求,集群规模亟待扩展。

而曙光集群的演进轨迹,也成为了不断突破集群规模边界的显著标志。

2010 年发布的曙光 6000(星云)采用 CPU-GPU 异构架构,验证了大规模异构计算系统的可行性;进入大模型时代后,曙光开始围绕 AI 训练重新设计基础设施,2025 年发布国内首个基于 AI 计算开放架构设计的曙光 AI 超集群系统,随后在年底发布了全球领先的大规模智能计算系统 scaleX 万卡超集群。直至今日发布的曙光 8000,代表着国产 AI 基础设施首次向十万卡规模发起挑战。

集群规模每发生一次跃迁,技术可能性的天花板也随之被抬高一层。与此同时,工程层面的考验也在升级。李斌将核心挑战归结为两点:性能效率与可靠性。

如何让增加的计算卡真正转化成有效算力,也是今天所有超大规模 AI 集群落地时首先需要回答的问题。

" 保证效率和卡数量一样呈线性增长,这是最大的挑战。" 李斌解释,此时的互联网络极度复杂,包含 Scale-Out 和 Scale-Up 两层架构。任何一个计算与网络的重叠掩盖没做好或系统设计存在任何短板,性能就发挥不出来。

据李斌介绍,中科曙光首先在 Scale-up 层面提升单柜计算密度,将 640 张加速卡集成于单个机柜内,尽可能缩短 GPU 之间的互连距离,并优先采用铜互联,以降低通信时延、功耗和系统复杂度。

他解释,在短距离条件下,铜连接通常具有成本、功耗和可靠性优势。英伟达 NVL72 等高密度方案同样遵循这一思路。但他同时表示,随着传输速率继续提高,铜互联必然面对物理瓶颈。

" 预计在 2029 年至 2030 年前后,硅光和 CPO(光电共封装)可能进一步进入柜内互联,届时计算芯片与光纤之间的距离会继续缩短。" 李斌表示曙光目前也正在布局相关技术路径。

而在机柜间,中科曙光自研 400G 高速网卡和 880G 交换芯片,构建起国产原生 RDMA(Remote Direct Memory Access,远程访问内存)高速互连网络 Scale Fabric,实现十万卡规模下的高带宽、低时延通信。

针对这一早在今年 3 月首发的网络方案,李斌表示,经过长时间的性能、可靠性与应用兼容性验证,Scale Fabric 未来有能力实现对 InfiniBand 的全面国产化替代。

除此之外,十万卡规模攀升背后是数量增加十倍的元器件。当潜在故障点随之翻倍,维持整个集群长期稳定运行的难度也在成倍放大。

李斌坦言,解决方式没有捷径,从最微小的部件到每一块板卡,曙光选择的是把每个单点的可靠性再提高一个数量级。

在这套逻辑下,液冷的角色被重新定义。李斌指出,液冷的关键作用并非单纯降低 PUE,而是让系统运行在一个恒定的、稳定的环境中,从而大幅提高整机可靠性。

在后续的国家超算互联网核心节点实地探访中,雷峰网 ( 公众号:雷峰网 ) 见到了中科曙光最新一代相变浸没式液冷机柜集群。机器运转的那一刻,一个感受变得具体:十万卡集群真正的工程复杂度,不只在于 " 点亮 ",更在于持续运营。

这无疑重新划定了算力产业的竞争边界。

国海证券计算机首席分析师刘熹认为,千卡集群的表现更多受到 GPU 和服务器等硬件性能影响,但随着规模走向万卡、十万卡乃至更大规模,组网、系统集成、散热、电源和软件调度等环节的重要性反而更加凸显。

另一位券商分析师补充,这种系统级能力无法通过短期采购快速获得,而是依赖长期积累的工程经验、方法论和工具链。

当 AI 基础设施的竞争从谁拥有性能更高的 GPU 升维至系统集成、工程经验和工具链的厚度,中科曙光显然已经站在前列。

超智融合,为什么成为十万卡的主战场?

但这并不代表模型已经进入十万卡时代。

在发布会现场,李斌透露目前曙光 8000 已与国内大模型团队合作完成语言模型、语义模型和世界模型的万卡级预训练,并为超过 400 个主流模型提供线上推理服务,此外还针对 PD 分离、KV Cache 等推理部署完成了大量高通量优化。

" 比较遗憾的是,现在没有找到任何一个大模型能跑到 10 万卡。" 李斌解释,当前模型参数扩展到万卡规模后,即使继续增加计算资源,性能也很难实现同步上升。

这意味着,当基础设施的扩张速度开始快于模型扩展能力,下一阶段比拼的不再只是有效算力的供给,而在于模型架构、训练算法和系统工程化层面的协同。

不过,这并不影响十万卡系统 " 跑满 " 应用需求。在 " 超智融合 " 技术路线的指引下,已接入国家超算互联网的曙光 8000 更像一座共享算力底座。

李斌指出,一方面,大模型时代的 AI 需要借助超智融合架构提供算力支撑;另一方面,传统的科学与工程计算也在 AI4S 的推动下走向智能化——这类场景本身就是混合负载。

他表示,当前基于曙光 8000 运转的 AI4S 项目中,超过 40% 已结合了机器学习方法。随着智能体、物理 AI 等方向持续发展,这一融合趋势还将加速。

值得注意的是,中科曙光的超智融合路线并非在不同机房里分别部署超算设备和智算设备,而是让同一个计算单元同时覆盖科学工程计算与神经网络计算。

根据其已披露的架构,曙光 8000 支持从 FP64 到 INT8 的多种计算精度,并可进行混合精度调用;底层平台由 6 款达到了国际先进水平的核心国产芯片、存储和互连系统等部件共同构成。

李斌介绍,当前超 300 项的超智融合应用优化覆盖了大模型、机器人、创新药、天文气象等二十余领域,其中 70 余项已完成万卡规模扩展,验证了核心节点在极端负载下的稳定性。此外,蛋白质折叠、万亿原子水分子模拟、百万亿网格湍流模拟等重点应用也已跑通。

随着曙光 8000 实现技术、生态、应用、服务标准完成闭环验证,曙光还将与北京科学智能研究院启动第二套全国产十万卡超智融合系统。李斌透露,下一代将更聚焦 AI4S,可能减少对部分纯 AI 通用场景的兼顾,以换取对科学任务更有针对性的支持。

正如中国工程院李国杰院士所言,大模型能力的边界,本质上仍然是语言的边界。而科学发现需要超越语言。对于 AI4S 来说,算力的意义不再只是训练更大的模型,而是帮助人类探索未知规律。

从服务模型到服务科学,这或许才是十万卡真正的下一步。

雷峰网雷峰网

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

曙光 基础设施 ai 超级计算机
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论