快科技 8 月 7 日消息,据报道,全球排名第一的国产超算 " 灵晟 " 成功完成纯 CPU 架构下的 MoE 模型分布式推理部署。该超算仅用 16 个计算节点即可流畅运行 DeepSeek-V3/R1-671B 满血模型,在并发数 batch_size=2048 时,输出吞吐量与 80 张主流 GPU 集群相当。
这意味着纯国产 CPU 架构首次在大模型推理领域实现了对 GPU 集群的正面抗衡,彻底颠覆了 " 跑大模型必须用 GPU" 的传统认知。

灵晟超算最独特之处在于其纯 CPU 架构路线。它没有采用堆砌 GPU 或专用加速卡的传统方案,而是在自研的 LX2 CPU 中直接集成了矩阵加速单元,支持多精度计算,让每颗 CPU 都能同时处理超算科学计算与 AI 推理任务。
这种片上融合的设计消除了 CPU 与加速卡之间数据搬移的开销。不过计算能力只是第一步,大模型推理的真正瓶颈在于内存带宽,模型参数需要频繁在计算单元和内存之间搬运。
为此 LX2 CPU 集成了首颗国产高带宽内存(HBM),总带宽达 4TB/s,相比传统 CPU 内存带宽提升 10 倍。搭配自研的 " 灵启 " 高速网络,支持微秒级时延与 10 万节点组网,扫清了计算、带宽和通信三大障碍。

实测显示,经优化后 MoE 推理时延从 1440 微秒大幅降低至 980 微秒。该团队还引入了 DeepSeek 多 token 预测加速技术,进一步提升了输出速率。
此次突破表示,灵晟超算不再只服务于传统科学计算,已正式纳入国产 AI 大模型的生产服务体系。
值得一提的是,今年 6 月 23 日,灵晟超算在德国汉堡 ISC2026 大会上正式登顶全球超算 TOP500 榜单,这是时隔九年中国超算再次排名全球第一。



登录后才可以发布评论哦
打开小程序可以发布评论哦