字节漫游指南 15小时前
摩尔线程张建中:AI竞争已不在于造模型,而在于建“三大AI工厂”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

为什么摩尔线程要在今年 WAIC 上抛出 " 三大 AI 工厂 " 这个概念?背景是清晰的:进入 Agent 时代,产业竞争的游戏规则正在被改写。过去,AI 主要是被训练出来的模型,企业比拼的是谁的模型更大、谁的评测分更高。而在张建中看来,竞争的焦点已经转移—— AI 正在变成一种需要被持续生产、调用和部署的智能能力。它不再是一个静止的产物,而是一条不断运转的流水线。摩尔线程把这条流水线拆成了三个彼此咬合的工厂:模型训练工厂、词元(Token)生产工厂和智能体生产工厂。这一定义,直接指向一个更根本的问题:下一代 AI 基础设施到底应该长什么样?

要理解这三座工厂,先得看对面的一场辩论。在基础设施到底该重训练还是重推理的问题上,产业界其实一直没有定论。正方观点很直接——模型训练决定一切。摩尔线程高级副总裁董龙飞在论坛上就把话挑得很明:" 产业人工智能的竞争最重要的就在于这个模型是不是聪明。" 这句话背后是一套朴素的产业逻辑:如果模型本身的认知能力不够,后续的推理、应用、智能体都是空中楼阁。他把 AI 比作一家企业,模型就是企业里的员工,员工先得有足够高的智商,才谈得上去执行任务。因此,模型训练工厂在三大工厂中扮演的是 " 能力源头 " 的角色,解决的是上限问题。而训练这件事的复杂性,远不只是算力堆多少卡那么简单。董龙飞特别强调了一个很多国产 GPU 难以绕过的门槛——训练结果一致性。简单说,就是用户已经在某个平台上花巨资训好了一个模型,现在迁移到新的国产 GPU 平台上,能不能拿到跟原来高度可比的损失曲线和精度?做不到,就没人愿意把自己的核心模型交给你。摩尔线程这次展示的万卡规模 MoE-236B 基础模型训练,就是用国产 GPU 集群从零开始跑,有效训练时长占比超过 90%,模型精度和损失曲线与国际主流计算卡高度对齐。这类案例想证明的,就是模型训练工厂的底座已经立住了。

但反方观点同样有力。中国工程院院士、清华大学教授郑纬民在同一个论坛上说了另一句话:算力基建的关键在于将每一份算力转化为高质量词元。如果模型训练工厂造出了聪明的模型,但每个 Token 都贵得让人用不起,智能的普惠就无从谈起。而且,一个被很多人忽略的变化正在发生—— Token 消耗的主力正在从人切换为 Agent。张建中判断,未来不是人在使用 AI,而是 AI Agent 在大量调用大模型。这就意味着,对算力和成本的优化不能再沿用过去 " 一张卡跑一个模型 " 的思路,而是需要一套系统工程。在这一维度上,摩尔线程的词元生产工厂试图回答的,就是 " 怎么让模型能力规模化释放 "。目前其推理套件已经适配了 DeepSeek、MiniMax、GLM、Kimi、Qwen 等主流模型,并推出了基于 MTT S5000 的 PD 分离异构推理方案。趋境科技给出的商业验证数据很具体:目前每天供应万亿级高品质 Token,并且通过与摩尔线程合作,实现国产 GPU 与国际主流 GPU 异构协同,以提升 Token 生产能力。这里隐含着一个产业判断:推理已经不再是训练的附庸,而是独立于训练的另一大市场,并且对基础设施的性价比、调度效率和异构算力协同提出了全新的要求。

还有第三个方向的争论:智能体生产工厂,到底只是概念先行,还是正在逼近现实?如果把 Token 工厂理解为 " 会说 ",智能体工厂解决的就是 " 会做 "。董龙飞给出的定义是,Agent 需要调用工具,在电脑里操作软件和系统,在物理世界里则需要机器人去执行。这就进入了 " 物理 AI" 的地界。大语言模型处理的是符号,而具备行动能力的智能体必须理解真实世界的物理规律,视觉、渲染、仿真、控制,这些任务拧在一起,对算力的消耗是数量级的提升。这也是为什么世界模型会成为具身智能的关键方向。极佳视界合伙人兼副总裁毛继明在论坛上提到一个关键矛盾:数字 AGI 主要依赖语言数据,但物理 AGI 需要处理真实世界数据,数据使用效率决定了这条路能走多快。极佳视界正在与摩尔线程联合做驾驶模型、具身模型等物理 AI 模型的训练优化,探索国产芯片训练国产模型的完整链路。如果这条链路跑通了,智能体生产工厂就不再是 PPT 上的概念,而是真正推开了 AI 从数字世界进入现实世界的大门。

这三条论据摆在一起,恰好指向一个容易被忽略的真相:三座工厂并非彼此独立的业务方向,而是同一套算力体系在不同市场里的投影。董龙飞明确指出,摩尔线程的三大工厂共享统一的 GPU 架构和 MUSA 软件体系,并不是针对不同市场分别开发不同技术。这正是全功能 GPU 与专用加速器之间的核心差异——在 AI 模型路线还在剧烈变化的今天,把 GPU 做得过于专用,就意味着押错了注就会满盘皆输。未来到底是语言模型还是世界模型主导,没人敢下确定性判断。所以基础架构必须具备足够的通用性,能随时在训练、推理和智能体三条战线上切换。京东云总裁曹鹏提到,京东已经在基于摩尔线程的国产算力做模型训练、适配和调优,全国产算力、国产模型、国产推理引擎组成的体系正在逐渐成型。这暗示着,围绕 " 三大工厂 " 展开的竞争,本质上是生态完整性的竞争,而不是单点突破。

把三大工厂串起来回看,摩尔线程这次在 WAIC 想定义的其实不是一款产品或一个业务,而是一种下一代基础设施的雏形。过去大家谈 AI,关注的是 " 造得好不好 ";张建中现在强调的是 " 产得顺不顺 "。从模型训练到 Token 生产再到智能体部署,这本质上是一条智能的生产线,任何一个环节的断裂,都会让整条产线停摆。产业里有人看重上游的训练精度,有人盯着中游的推理成本,还有人押注下游的物理智能爆发,但真正让这套体系具备持续竞争力的是统一的底座和完整的覆盖。当 Agent 开始大规模调用模型、机器人开始走进现实场景时,谁手里有一套经受过全链路验证的国产算力方案,谁就拿到了下一个时代的入场券。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

摩尔 ai 建中 gpu 基础设施
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论