钛媒体 前天
摩尔线程公布万卡级集群训练成绩 称国产芯片可训出前沿模型
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 世界人工智能大会(WAIC)期间,摩尔线程披露,一款 236B 参数的 MoE 模型基于国产万卡级集群训练,一款具身智能大脑模型,基于国产千卡集群训练,此外,北京大学 EvoPhys 团队首个全球 5D 世界模型 EvoPhys-World 的全栈原生训练,全程由 MUSA 软件栈提供底层支撑。

其中,MoE-236B 模型基于 25T+ 语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过 90%。

" 高精度 " 是摩尔线程反复强调的能力,摩尔线程高级副总裁董龙飞提到,它指的不是单次计算的数值精度,而是模型在不同 GPU 平台间迁移训练时的结果对齐能力,即相同模型架构、训练数据、超参数下,能否获得稳定、可比的训练结果。

摩尔线程给出的具体数据是,在 DeepSeek 一类 MoE 模型上,与国际主流 GPU 做对比训练,前 3 万步的平均相对误差控制在万分之六以内。摩尔线程还以 500B 至 5T 不等规模的数据做过多轮实验,称基于相同卡数、模型配置和训练流程,摩尔线程平台训练所得模型在下游 Benchmark 评测中的得分与参考平台基本一致,部分指标更高。

摩尔线程与北京大学 EvoPhys 团队合作训练的 5D 世界模型 EvoPhys-World,基于 MTT S5000 完成全栈原生训练,在 WorldScore" 世界生成 " 维度连续 37 天排名第一,该项目获得摩尔线程 " 灯塔计划 " 支持,这是国内第一次由中国科学家在中国算力设备上完成的原创世界模型工作,也是 " 国芯训国模 " 的一个分水岭。

此外,北京智源研究院的 RoboBrain 2.5 具身大脑模型,基于 FlagOS-Robo 框架,依托摩尔线程 MTT S5000 千卡智算集群,双方成功完成 RoboBrain 2.5 的全流程训练。首次验证了国产算力集群在具身智能大模型训练中的高可用性与效率。

摩尔线程创始人、董事长兼首席执行官张建中将 AI 产业按功能拆分为三类 " 工厂 ":模型训练工厂、词元生产工厂、智能体生产工厂。三者共用同一套全功能 GPU 架构,这也是摩尔线程与专用芯片路线(ASIC)厂商的核心分野。

词元生产工厂方向,摩尔线程重点展示了基于 MTT S5000 的 PD 分离异构推理方案,将算力需求大的 Prefill(预填充)计算放在 S5000 上,将带宽需求高的 Decode(生成)计算放在国际主流 GPU 上,两者异构分池部署。

张建中在演讲中给出的数据是,异构组合后整体吞吐量较原有方案提升近 2 倍,并给出算式,"3 台 S5000+2 台国际主流 GPU ≈ 9 台国际主流 GPU"。董龙飞补充表示,这类异构方案的性能比任何同构方案都要高 50% 以上,其中很大一部分收益来自 KV Cache 的调度优化,在类似 OpenClaw 这样反复调用本机命令行工具的场景下,缓存命中率可达 90%,相当于节省 90% 的算力。

据悉,过去一年,国产大模型发布后到完成硬件适配的周期已从 " 数月 " 压缩到 " 发布即适配 "(Day 0 适配),部分大模型厂商现在会在模型规划部署阶段就与摩尔线程同步 " 共研 ",而不是等模型发布后才启动适配工作。

在具身智能方面,早期 VLA/VLM 类模型参数在 5B 至 14B 之间,主要部署于端侧;当前的世界模型路线不再依赖语言输入,直接处理物理世界,参数跨度更大,实现高质量具身控制大致需要 10 亿参数级别模型在端侧运行,同时配合千亿级(1000B)及以上模型在云端协同。摩尔线程正基于自有万卡级集群持续进行万亿参数模型的训练验证,但未公布具体进展和时间表。

提及算力供应话题,董龙飞表示,中国的算力建设是面向未来十至二十年的基础设施投入,短期供不应求属于正常现象,以铁路、高速公路等基建类比,中国 GPU 或算力企业远未发展到 " 供过于求 " 的地步。(本文作者 | 张帅,编辑 | 杨林)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

摩尔 北京大学 gpu 芯片 中将
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论