
在 2026 世界人工智能大会暨人工智能全球治理高级别会议上,全国产 10 万卡人工智能超集群曙光 8000 进行展示。龙巍 摄(影像中国)

在世博展览馆,参展商(左)在中科曙光展台前作介绍。新华社记者 张笑宇 摄

近日,我国首个全国产 10 万卡人工智能超集群——曙光 8000 正式落成投用,并同步接入国家超算互联网郑州核心节点。这标志着我国算力基础设施建设正式迈入 10 万卡级部署阶段。曙光 8000 投用首周已实现满载运行,日均处理作业数突破 15 万个,单日处理作业峰值超过 50 万个,已完成多项超智融合应用适配,覆盖大模型训练、高通量推理、科学计算等多个应用场景。
在近日举行的 2026 世界人工智能大会暨人工智能全球治理高级别会议上,曙光 8000 被列入本届大会十大 " 镇馆之宝 "。这台 " 超级大脑 " 如何炼成?它将在哪些领域发挥作用?记者进行了采访。
将高精度科学计算与低精度智能计算能力统一到同一系统中
超算和智算都是处理海量数据、支撑前沿科技的算力基础设施。超算主要立足科学研究,定位于大科学、大工程的问题求解,追求计算精度,如气象预测、飞行器设计、地震模拟等,都是它的应用领域;智算则偏重人工智能算法和模型创新,虽然对精度要求不高,但追求计算性能,支撑大模型训练与推理、自然语言处理、自动驾驶等人工智能融合应用。
随着大模型规模提升、计算场景扩展和智能化应用的深入,亟须能够应对高并发、高吞吐、多精度和多任务负载的新一代算力基础设施。
" 人工智能正在从大模型向智能体、具身智能快速演进,需要同时具备支持高精度的科学计算和低精度的人工智能训练的能力,这就要求计算系统在架构、规模、能效和可靠性上进一步创新。" 中国工程院院士李国杰说。
" 面对庞大而异构的算力需求,构建开放、高效、协同的计算生态,成为释放智能计算价值的关键。" 中国科学院院士鄂维南表示。
曙光 8000 就是在这一背景下研制的。作为超集群,曙光 8000 将成千上万张计算加速卡进行高速互联,在逻辑上将其整合为一台统一调度的 " 巨型计算机 ",从而提供超大规模的并行算力。
" 它采用了‘超智融合’的技术路线,将高精度科学计算与低精度智能计算能力统一到同一系统中。" 中科曙光高级副总裁李斌解释,这意味着,一个芯片、一个计算单元既需要具备对科学工程计算、数字计算仿真的支撑能力,也需要具备对神经网络类算法的支撑能力。
曙光 8000 正是这样一个面向多场景、多精度、多任务的综合型计算系统。李斌介绍:" 曙光 8000 覆盖双精度 64 位到 32 位、16 位、8 位甚至更低精度,也提供灵活混合精度调用能力,可满足科学计算、大模型训练、人工智能推理、工业仿真等计算需求。"
从千卡、万卡到 10 万卡,计算基础设施的建设逻辑也在发生变化。与千卡、万卡级系统相比,10 万卡部署考验的不只是计算卡数量和理论峰值性能,更包括系统架构、网络互联、存储访问、能效控制、资源调度和工程交付能力。
系统创新造就 " 超级工程 "
这样一个巨大的综合型计算系统,是名副其实的 " 超级工程 ":30 亿颗电子元器件实现精密协同,互联线缆总长超 1600 公里,系统总重 1500 吨……而这一切,需要被压缩在不足 0.05 毫米的结构组装精度之内——甚至比一张普通 A4 纸还薄。
在系统建设上,曙光 8000 具有 " 芯片、计算、存储、网络、散热、应用、服务 " 全链路全自研人工智能基础设施能力,从核心部件的研制到系统落地均实现全国产化。
" 从万卡到 10 万卡,不是简单乘以 10,更要在规模扩大之后让它‘跑’出应有的性能效率。" 李斌举例,算力协同方面,随着体系结构向复杂的异构计算演进,任何计算或网络节点的短板,都会导致整体性能大幅衰减;系统可靠性方面,元器件数量上升会导致理论故障率的上升,系统架构的复杂化又会进一步加剧维持稳定运行的难度。
应对这些挑战,并没有太多的捷径可走。曙光 8000 研制过程中,任何一个板卡所要求的可靠性都要比通用计算设备高出一个数量级。而供电、冷却等支撑系统的设计和制造环节,更是耗费了团队大量的心血,用李斌的话说," 曙光 8000 需要的是前所未有的系统创新 "。
值得一提的是,国产算力芯片及基础软硬件生态的长足进步,为曙光 8000 系统建设提供了重要支撑。比如,曙光 8000 应用的分布式存储技术,在今年 6 月发布的全球存储系统性能基准测试 IO500 榜单中,取得生产型全节点和 10 节点榜单 " 双榜第一 " 的好成绩。这套存储系统能够支撑大模型训练和科学计算中的海量数据读写,保障大规模集群高效运行,证明国产高端存储技术已在全球算力体系中具备领先实力。
我国自主研发的相变浸没液冷技术,为应对大规模计算集群散热挑战提供了新途径。曙光数创高级副总裁张鹏介绍:" 曙光 8000 将全部计算设备浸没在氟化液中进行降温。氟化液沸点在 50 摄氏度左右,而设备运行温度在 80 至 90 摄氏度之间,当设备运行温度上升后,氟化液就会沸腾相变,并由传输管道进入冷凝器,冷却后的气体再次转换为氟化液,可实现闭环循环利用。"
此外,高速网络、数字孪生运维和多元融合调度等技术,共同提升了超大规模集群的运行效率和应用适配能力。在业内专家看来,打通芯片、整机、基础软件到智能应用的全栈国产化链路,构建新一代智能基础设施,具有深远的战略意义。
支撑算力产业 " 攀高峰 "" 建高原 "
建好更要用好。作为全国首个 10 万卡级超算、智算融合的算力资源池,曙光 8000 投用后即同步接入国家超算互联网,并依托国家超算互联网接入全国一体化算力网,面向科研院所和产业用户提供算力服务,支撑气象预测、材料设计、能源勘探、生物医药、量子计算、流体仿真、工业仿真、大模型训练与推理等场景,并形成更大范围的算力协同和应用支撑。
" 我国算力产业既要‘攀高峰’,也要‘建高原’。" 国家高性能计算机工程技术研究中心副主任曹振南说," 攀高峰 " 就是采用自主技术,研制世界上顶尖的计算机和系统;" 建高原 " 就是依托国家超算互联网,把机器、超算中心连接起来,更把人才、应用和生态连接起来。
2024 年 4 月,由国家部委指导发起建设的国家超算互联网正式上线,已建成汇聚超 350 万 CPU(中央处理器)核、25 万 GPU(计算加速卡)卡的全国规模最大一体化算力网络与应用服务平台。国家超算互联网郑州核心节点上线后,国家超算互联网面向新用户推出普惠资源包,包含 200 卡时算力、1000 万词元调用额度和 500G 存储资源,并可选用主流大模型。高校师生和青年科研团队可以用更低成本完成模型测试、算法验证和科学计算实验;人工智能开发者和中小企业则可以在正式投入前快速完成应用原型搭建和模型验证。
国家超算互联网总工程师郭庆介绍,除支撑重大科研攻关外,国家超算互联网正推动算力向更广泛的用户群体渗透,目前国家超算互联网累计用户超 140 万,用户平均年龄持续降低,从中学生到专业科研人员均可接触到高端算力资源。
据介绍,曙光 8000 已完成 300 余项重点应用深度适配,覆盖 20 多个行业领域。在典型场景中,该系统已支撑新一代气象大模型开发部署,推动能源领域核心成像算法在国产化平台上的移植优化,并在生物、材料、流体等领域支撑蛋白质折叠过程模拟加速等超大规模任务。
" 过去一年,我们基于国家超算互联网的底座,构建了若干科学计算智能体,将原来复杂的科学计算流程封装成简便易用的基于自然语言交互的智能体服务,已经覆盖 100 多个核心计算场景。" 曙光智算总裁何牧君介绍。
曙光 8000 不仅是单项技术突破和产品创新,更是产学研用协同的成果。近年来,中科曙光围绕国产通用计算平台构建产业生态系统联合体,旨在解决国产计算平台生态碎片化问题,推动自主可控信息技术生态的发展,目前已汇聚超过 6000 家产业合作伙伴,共同推动我国计算产业发展。(记者 谷业凯)


登录后才可以发布评论哦
打开小程序可以发布评论哦