金融界 3小时前
摩尔线程披露236B MoE模型 国产万卡集群训练时长占比超90%
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 世界人工智能大会(WAIC)期间,摩尔线程披露了一款 236B 参数的 MoE 模型基于国产万卡级集群训练,同时展示了从训练到推理的全栈算力方案。

此外,一款具身智能大脑模型基于国产千卡集群训练。该 MoE-236B 模型基于 25T+ 语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过 90%。

摩尔线程的夸娥万卡集群包含 10240 张 GPU、10EFLOPS 算力,Dense 模型利用率 60%,有效训练时长超 90%。此外,北京大学 EvoPhys 团队首个全球 5D 世界模型 EvoPhys-World 的全栈原生训练,全程由 MUSA 软件栈提供底层支撑。

在推理侧,摩尔线程展示了基于 MTT S5000 的高性能推理方案,FP8 算力 1000 TFLOPS,单卡推理吞吐 Decode 1000 tokens/s、Prefill 4000 tokens/s。展台还展出了十万卡的算力集群 MTT C256,以及自研数字智能体 " 小麦 ",掌握 60 多项技能,支持 38 款 APP 的跨应用控制。

生态合作方面,趋境科技在摩尔线程分论坛上透露,其使用摩尔线程全功能 GPU 与国际主流 GPU 深度融合,已具备日均万亿级高品质词元供应能力。

免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

本文源自:观点网

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

摩尔 gpu 技能 北京大学 世界人工智能大会
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论