钛媒体 1小时前
李飞飞不等了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大语言模型的红利期进入后半段,物理世界成了巨头们共同看中的下一个方向。资本入场比概念更早,仅今年一季度,全球物理 AI 领域的融资就超过 64 亿美元,资金明显向世界模型和基础模型集中。

让 AI 在 " 脑子里 " 预演物理世界、再到现实里执行,被视作通向机器人、自动驾驶和下一代计算的必经之路。这条路上最早也最响亮的布道者是李飞飞,她那句 "宇宙并非由文字构成,而是由真实的事物构成",几乎成了整个赛道的开场白。

这条路线刚起步,创办它的李飞飞就带着公司投靠了 AMD。

AI 的下一步,从预演世界开始

交易以约 82 亿美元的全股票方式进行,完成后,她将出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报。这家公司成立不过两年多,今年 2 月刚完成一轮 10 亿美元融资,投后估值约 54 亿美元,短短七个月后,AMD 开出的价格又高出了五成多。

这是 AMD 史上第二大收购,仅次于 2022 年约 500 亿美元的赛灵思。但和赛灵思不同,World Labs 没有成熟的产品线,也没有披露过收入数字。它的第一款商业产品 Marble 去年 11 月才正式上线,新一代模型 Atlas 更是在交易宣布前不到一个月才亮相。

交易宣布前不到一个月,英伟达刚刚签约以约 129 亿美元收购开源模型社区 Hugging Face,两大芯片巨头在同一个月里,先后把手伸向了模型层。

2012 年,一个叫 AlexNet 的神经网络在 ImageNet 图像识别竞赛中大幅领先,它是用英伟达 GPU 训练的。那场比赛被普遍视为深度学习时代的起点,也间接成就了英伟达此后十几年的 AI 霸业。而 ImageNet 的创造者,正是李飞飞。如今,她选择了 AMD。

消息在美股收盘后传出,AMD 官方数据显示,盘后股价仅微涨 0.40%,随后三个交易日累计涨幅也不到 2%。一家被寄予厚望的明星公司,一笔创下纪录的收购,资本市场的态度却相当平静,世界模型这条赛道,眼下还撑不起一个确定的估值。

然而,撑不起估值的一部分原因恰恰出在 " 世界模型 " 这四个字上。大语言模型擅长的是语言,它能把物理讲得头头是道,却未必真的 " 懂 " 我们所在的物理世界。而世界模型的核心想法,是让 AI 在 " 脑子里 " 先把世界预演一遍,再决定怎么行动。

世界模型和游戏引擎、物理引擎的区别也很直观:后者是工程师一行行 " 写 " 出来的规则,前者是 AI 从海量视频和传感器数据里 " 学 " 出来的规律。规则精确、可验证,但写不完现实世界的复杂。学出来的规律理论上可以泛化到没见过的场景,代价是不够精确,时不时会 " 幻觉 "。

天气预报提供了一个现成的参照,传统的数值天气预报是把大气切成网格,一格一格地解流体力学方程。过去几年,谷歌 DeepMind 的 GraphCast、华为的盘古气象等AI 模型不再解方程,而是直接从几十年的气象数据里学习天气如何演变,在不少指标上已经能与传统方法比肩,速度还快得多。AI 气象模型,本质上就是一个 " 只管天气 " 的世界模型。

世界模型公司想做的,是把这件事从天气推广到整个物理世界。

不一样的世界模型

李飞飞今年 6 月发文承认,计算机视觉、机器人、强化学习和生成式 AI 各自都说自己在做世界模型,但说的根本不是同一件事。这篇文章给出了一个分类,大致可以把市面上的世界模型分成三个层次。

渲染器根据条件生成逼真的画面或 3D 场景,本质上离视频生成和 3D 生成并不远。模拟器给定一个动作,预测世界会怎么变化,比如 " 机器人手往左移 5 厘米,杯子会不会倒 "。规划器用内部对世界的理解,直接决定下一步该怎么做,这才是世界模型最初的学术含义。

落到具体玩家身上,腾讯混元的 HY-World 和 World Labs 的 Marble 主要停留在第一层,生成可以走进去、可以导出的 3D 世界。谷歌的 Genie 3 和昆仑万维的 Matrix-Game往前多走了一些,画面会随着用户的操作实时变化,介于第一层和第二层之间。

以色列公司 Decart 则两头下注,Lucy 实时改写视频画面,偏向渲染。Oasis 面向机器人和自动驾驶,偏向模拟。英伟达的 Cosmos 是一整套产品线,从画面生成到物理推演都有覆盖,重心落在机器人和自动驾驶上。Waymo 和 Wayve 的驾驶模型,则是第二层最典型的代表。杨立昆创办的 AMI Labs直奔第三层,干脆不生成画面,只在抽象空间里学习 " 世界如何运转 "。

不过,当前大多数商业化的 " 世界模型 ",主要做的是第一层。昆仑万维的 Matrix-Game 团队曾把世界模型拆成三步,理解当前状态、预测下一状态、渲染呈现。

多数模型其实跳过了前两步,直接去做了渲染。昆仑万维董事长方汉倒是早在 7 月的世界人工智能大会上就宣布,2026 年是 " 世界模型元年 "。连 AMI Labs 的 CEO 勒布伦今年 3 月都对 TechCrunch 说过," 世界模型 " 会是下一个热词,六个月之内,每家公司都会自称世界模型公司去融资。市场常常在用第三层的愿景,给第一层的产品定价。

落地的用法有了,还都很朴素

说世界模型还停留在 PPT 阶段,并不公平。它已经有了真实的用户,只是用法比宣传中朴素得多。

今年 2 月,Waymo 发布了基于谷歌 Genie 3 改造的 Waymo World Model,能模拟龙卷风、被淹没的街道,甚至公路上出现一头大象这类车队从未真正遇到过的场景。英国自动驾驶公司 Wayve 8 月发布的 GAIA-4,已经能把驾驶 AI 放进闭环:AI 做出不同的决策,它 " 看到 " 的路况就随之改变。自动驾驶之所以先行一步,原因在于数据最丰富,需求最明确,而极端场景在现实中根本没法反复测试。

机器人领域则把它当成 " 数据工厂 "。Agility Robotics、Figure AI、Skild AI 等公司都是英伟达 Cosmos 的早期用户,用它批量生成真实世界难以采集的训练数据。内容创作端,Decart 称已有超过 10 万名开发者基于其模型做产品,主要集中在电商和直播。腾讯开源的 HY-World 2.0,直接瞄准游戏地图和关卡原型的制作。

" 用不完美的数据训练机器人 ",是外界最常见的质疑:模型自己都不太懂物理,拿它生成的数据去训练机器人,等于在教错东西。业内人士的看法恰恰相反,合成数据的价值从来不在于 " 真 ",而在于便宜、多样、可控。飞行员在模拟器里反复练习发动机失效,模拟器的手感和真飞机并不完全一样,但这些情况在真飞机上根本不敢练。机器人也一样,它们最缺的,恰恰是现实中采集不到的数据。

这类做法已有实证,今年 ICLR 上的 Ctrl-World 研究显示,仅用世界模型生成的合成数据做后训练,机器人在陌生物体和新指令上的成功率就从 38.7% 提升到 83.4%。企业对合成数据的用法也相当清醒,英伟达的 Cosmos Transfer 让传统仿真引擎负责保证物理和几何的准确,世界模型只负责把画面变得逼真多样。

大语言模型有整个互联网的文本可以学,世界模型面对的却是一块空白,世上没有一个现成的 " 物理互联网 ",普通视频里没有力反馈、碰撞和物体交互的真实数据,而这些恰恰是机器人最需要的。

中科院院士周志华在今年 7 月的世界人工智能大会上点出了第二重麻烦:世界模型多步推演的误差不是线性累加,而是按平方级放大,推得越远,崩得越彻底。哈佛、MIT 等机构联合发布的 MemoBench 测的正是这类基本功," 物体恒存 ",东西离开视野再回来,还在不在原处。这对人类来说近乎常识,但据报道,十个主流世界模型在这项测试中集体不及格,满分 1 分,最高只拿到 0.58 分。

算力的账更难算,据业内估算,世界模型所需的 GPU 算力是同等规模大语言模型的数倍乃至数十倍,实时生成高清画面往往需要多卡并行。

商业闭环的难题排在最后,World Labs、Decart 等头部公司都没有公开过营收数据,技术能跑通,不等于客户愿意持续买单。所以,今天的世界模型,更像是嵌在自动驾驶、机器人和内容生产流程里的一项能力,而不是一个能单独撑起一家公司的产品。这一点,也是理解 AMD 这笔收购的钥匙。

苏姿丰出手,李飞飞点头

World Labs 这边,两年多累计融资约 12 亿美元,放在任何一个软件赛道都是天文数字,但放在前沿模型赛道,并不宽裕。世界模型要处理视频、多视角、三维几何和实时交互,训练和推理都比大语言模型更吃算力。

商业化同样现实,Marble 是一款相当不错的工具,能把几张照片变成可以漫游、编辑、导出到 Unreal 和 Unity 的 3D 场景,用户主要是游戏、影视和 VR 团队。但它属于 " 渲染器 " 这一层,做的是一门工具生意。而李飞飞真正想做的 " 空间智能 ",需要的是长期、不计短期回报的投入。

李飞飞在公告里说,推进下一代 AI,"需要在模型研究、系统和计算之间紧密协作"。世界模型离不开算力,与其排队买卡,不如直接 " 加入 "。她在官宣当天发布的公开信题为《去寻找一个更新的世界》,取自丁尼生长诗《尤利西斯》里那位拒绝靠岸、执意再度远航的老水手。

" 随着公司的发展,我们的雄心也在不断扩大 ",而雄心的扩大带来的是对算力需求的扩大,李飞飞说," 如果我们能够与 AMD 携手合作,就真的能为我们自己、AMD 以及整个生态系统,创造一个加速软件和硬件开发之间飞轮效应的机会"。

在物理 AI 这件事上,AMD 一直是追赶者。英伟达的 Omniverse 仿真平台和 Isaac 机器人工具链经营多年,2025 年初推出的 Cosmos 世界模型如今也已迭代到第三代。反观 AMD,此前公开发布的主要是文本和视频模型,自己在世界模型上只做过零星尝试,更多是以投资人的身份押注 World Labs、Odyssey 这样的公司。

AMD 今年连着做了四笔收购:6 月买下做内存优化的 MEXT,7 月收编端侧推理软件团队 FastFlowLM,8 月收购推理芯片公司 Taalas,9 月拿下 World Labs。前三笔都是在推理效率和系统层面补课,World Labs 是第一次押注一个连英伟达都还没完全占住的方向。

Taalas 的做法是把 AI 模型直接 " 刻 " 进芯片,按它自己的说法,从拿到模型到做出芯片只需两个月左右。现在 AMD 手里又有了一个前沿模型团队,理论上具备了一种新的可能,不再只是让硬件去适配模型,而是由模型来定义硬件。只是世界模型几个月就迭代一代,而芯片一旦定型就难以更改,这条路能否走通,还要打一个问号。

AMD 买的不只是 " 看清需求的能力 "

不少分析认为,AMD 花 82 亿美元,买的是提前几年看清 AI 算力需求的能力。芯片从定义到量产要三到五年,理解未来的工作负载当然重要。但如果只是想看清需求,合作就够了:双方从 2025 年起就在 AMD GPU 上联合优化模型训练和推理,李飞飞今年初还登上了 AMD 的 CES 舞台。

花 82 亿美元全资买下,AMD 要的首先是排他性。英伟达同样是 World Labs 的投资人,收购之后,这支团队只属于 AMD。其次是补齐对标英伟达 Cosmos 的拼图。更长远看,是要拿到定义需求的话语权。

苏姿丰在采访中说:" 你对整个端到端流程了解得越深入,就越能打造出更好的系统。这就是我们收购 World Labs 的原因 "。谈到目标,她直言:" 你将同时拥有开源模型和专有模型 ",而 AMD 的雄心,是 " 定义 AI 计算的未来 "。

当年英伟达的护城河不是预测出来的,而是在 AlexNet、CUDA 和一代代研究者手里 " 养 " 出来的。AMD 想复制的,正是这个过程:让下一代 AI 负载,从一开始就生长在自己的芯片和软件上。

这笔交易全部用股票支付,是后来者以小博大的打法,也让 AMD 的扩张高度依赖自身股价。

收购完成后,世界模型赛道的主要力量,几乎都和一家算力巨头绑在了一起。英伟达自研 Cosmos,同时投资了 World Labs、AMI Labs、Decart 和 Odyssey 等一众初创公司。谷歌有 Genie,并已在 Waymo 落地。亚马逊则用自研的 Trainium 芯片,把 Decart 和 Odyssey 签成了 AWS 的客户。

现在,AMD 拥有了 World Labs。

仍然独立的头部公司,如 AMI、Decart、Odyssey 和 General Intuition,大多也已经通过融资或合作,和某个算力阵营产生了关联。" 中立 " 的世界模型公司,正在变成稀缺品。

对研究本身,这笔交易或许会带来一些变化,苏姿丰和李飞飞在交易当天的联合受访中都表示,AI 仍处在非常早期阶段,未来的竞争在于软件与硬件的协同进化。模型与芯片的协同设计会加速,世界模型的计算特征与大语言模型差异很大,它要同时处理大规模视频、多视角空间信息、三维几何和低延迟交互,当世界模型团队第一次能直接参与定义芯片,算力这道坎有可能从硬件端得到缓解。

3D 路线也拿到了 " 长期饭票 ",李飞飞在公开信中承诺,要在 AMD 内部建立一个可持续数十年的前沿研究组织,并坚持提供广泛可访问的开放模型,不必再按融资周期赶进度,World Labs 可以做更长线的研究。

不过这笔交易并没有给路线之争下结论,世界模型的技术路线至今没有收束,也没有跑通。收购证明的是 World Labs 的团队和品牌值钱,而不是 3D 路线就是终局。 ( 本文首发钛媒体 APP,作者 | 硅谷 Tech-news,编辑 | 郝敬钰 )

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论