
2026 年,世界模型正在成为具身智能发展的重要基础。在此之前,OpenAI 的 Sora、Google DeepMind 的 Genie、Wayve 的 GAIA-1 相继将「视频生成」「交互环境」「驾驶仿真」推向产业视野。
一个曾主要存在于强化学习论文中的概念,正在成为机器人、空间智能等竞逐的新基础设施。
这场竞争的重点,已经不再是「生成一段多逼真的视频」。
对于具身智能而言,真正稀缺的能力是机器能否理解眼前的物理世界,预判动作带来的连锁反应,并在低风险、低成本的虚拟环境中先试错,再把经验迁移到真实机器人身上。
换句话说,世界模型要让机器不只是「看见世界」,更要学会「在世界中行动」。
当前世界模型可梳理为四条路线:表征式、生成式、交互式,以及理解—生成—预测一体化。
它们不是彼此替代的关系;更准确地说,这是世界模型从「认识世界」走向「改变世界」的能力阶梯。

而来自中国的大晓机器人所代表的路线,正指向第四阶段:将理解、生成、预测和控制放进同一个闭环。这也是当前世界模型最值得关注的演进方向之一。
1、表征式世界模型把世界「压缩成可计算的规律」
表征式世界模型解决的第一个问题是:如何让机器知道,世界究竟由什么构成。
现实世界的信息密度极高。一个机器人看见桌面,不只是看见一堆像素,而是需要区分杯子、剪刀、桌沿、人的手,理解它们之间的距离、遮挡、材质和可操作性。
表征式世界模型的任务,就是将这些复杂输入压缩成更稳定、更可用于推理的「潜在状态」。
Yann LeCun 提出的 JEPA 是这一方向的重要代表。与直接预测每一个像素不同,JEPA 强调在抽象表征空间中预测被遮挡或未来的信息。
它关心的不是「下一帧每个像素是什么颜色」,而是「这个物体会移动到哪里」「两个物体之间的关系会不会变化」。
Meta 的 V-JEPA 则将这套思路推进到视频学习。模型从大量无标注视频中学习物体持续性、运动和场景变化。
比如,一个球短暂被遮挡,模型需要理解球并未消失,而是仍在沿某种轨迹运动。这种能力对于机器人避障、抓取和连续任务执行十分基础。

Dreamer 系列则展示了另一条路径:
让智能体在潜在空间中「想象」未来。它先学习环境的压缩表示和状态转移规律,再在内部模拟多步动作结果,以较少的真实交互数据完成决策训练。
表征式路线的优点是高效。它不需要事无巨细地复刻现实,因此更适合做规划、控制和强化学习。
但它的短板也很清楚:一张抽象地图可以帮助机器理解「哪里能走」,却未必能直接提供一个足够丰富、可反复交互的训练世界。
2、生成式世界模型让机器先「想象未来」
生成式世界模型进一步回答:如果世界沿着某种条件发展下去,可能会变成什么样?
Sora 让这一方向首次获得大规模公众关注。
OpenAI 在其技术文章中提出,视频生成模型在学习海浪、车辆、人群、光影和物体运动的过程中,也在一定程度上学习物理世界的规律。
这类模型的想象力极具吸引力。
输入「厨房台面上的玻璃杯被手臂碰到」,模型可以生成杯子倾倒、液体流动、物体碰撞后的画面;输入一段道路视频,它可以尝试生成不同天气、交通流和光照条件下的未来场景。
对于数据高度稀缺的机器人行业,这意味着模型有机会批量制造训练样本。
Google DeepMind 的 Genie 则把「生成世界」推进了一步。它可以根据图像、照片或文本提示生成可交互的二维环境,用户或智能体能在其中移动并触发环境变化。
虽然 Genie 距离通用三维机器人仿真仍有距离,但它验证了一件重要的事:生成模型不必只负责播放视频,也可以成为智能体探索的环境。

这一阶段的价值,在于让机器人获得近乎无限的「合成经验」。
现实数据采集昂贵、缓慢且可能伴随安全风险;而在生成世界中,机器人可以在不同光照、地形、物体摆放和异常情境下反复试错。
不过,生成得像,并不等于预测得准。
视频模型常见的「物体漂移」「手指变形」「因果关系错位」,放到具身智能中都可能造成严重问题。
机器人不能因为模型生成了一段「看起来合理」的视频,就相信机械臂一定能够抓住玻璃杯。
3、交互式世界模型机器开始学习「动作的后果」
交互式世界模型的关键变化,是将「动作」纳入模型。
它不再只生成一个可能的未来,而是回答更具操作性的问题:
如果机器人向左移动半米,画面和物理状态会如何变化?
如果机械臂以不同角度抓取,物体会滑落还是被稳定夹住?
如果自动驾驶汽车减速,周围车辆和行人会作何反应?
Wayve 的 GAIA-1 是自动驾驶领域的典型案例。它尝试将视频、文本和驾驶控制信号结合,生成具有不同道路结构、交通参与者和天气条件的驾驶场景。
其意义不只是「合成一条道路视频」,而是让开发者能够在虚拟情境中检验驾驶策略:当车辆转向、加速或制动时,环境会如何反馈。
这类模型尤其适合处理长尾场景。
现实道路上,施工围挡、突然横穿的行人、异常停车的车辆等高风险案例相对少见,却恰恰是系统必须处理的难题。通过交互式世界模型,研发团队可以更低成本地构建这些测试情境。
在空间智能领域,World Labs 推出的 Marble 也体现了相近方向:
从图像、视频或文本构建可探索的三维空间,使智能体不仅「看见一张图」,而是获得具备空间结构和可导航性的环境。
交互式世界模型把行业的关注点从「生成内容」转移到「模拟后果」。
但它也面对更高要求:模型既要处理视觉真实感,又要维持三维几何、物理约束、动作响应和长时序一致性。
4、理解、生成、预测一体化世界模型走向具身闭环
第四条路线不满足于把理解、生成、预测拆成多个模块,而是试图将它们整合成一个面向行动的系统。
大晓机器人代表的正是这一方向:
不是单独做视觉理解、视频生成或局部交互仿真,而是尝试把对世界的理解、对未来的生成、对动作后果的预测,以及真实机器人控制连接起来。
这也是其作为中国世界模型探索成果的重要意义所在。这样的成果也让英伟达用于了 Cosmos 3 中。
这一思路背后的产业判断是:
具身智能不是单一模型问题。机器人要完成「进厨房拿取指定物品」这样的任务,需要视觉识别、空间记忆、语言理解、未来状态预测、路径规划和动作控制连续协作。
任何单点能力都无法独立承担全链路任务。
过去,中国具身智能企业更多从机器人本体、执行器、视觉感知或垂直应用切入;
一体化世界模型则提出了更高的系统命题——让机器人在行动前完成内部推演,在行动中持续校正预测,并在行动后将经验沉淀为下一轮学习数据。
如果这一闭环能够在真实任务中跑通,世界模型将不再只是一个「数据生成工具」,而会成为机器人系统的认知与决策中枢。
但也应看到,一体化并不等于万能。
评价这类模型,不能只看概念、参数规模或演示视频,而要回到可验证的指标。在未见过的场景中,任务成功率是否稳定;
在长时序任务里,预测是否持续一致;模型预测与真实物理结果之间的偏差有多大;虚拟环境中学到的策略,能否有效迁移到真实机器人;面对失败、干扰和意外时,系统能否及时修正。
因此,更客观的判断是:
大晓机器人所代表的一体化路线,符合世界模型由分散能力向具身闭环收敛的最新趋势;其作为中国世界模型的重要成果的价值,将取决于真实场景表现。
5、世界模型的竞争,正在从「会生成」走向「会决策」
四条路线并不是一场非此即彼的淘汰赛。
表征式模型提供对世界的抽象压缩;生成式模型提供可扩展的未来样本;交互式模型建立动作与后果之间的联系;一体化模型则尝试将感知、推理、预测和控制连接起来。
它们最终可能汇入同一个方向:世界模型不再只服务于内容生成,而是服务于现实决策。
这也解释了为什么具身智能会成为世界模型最重要的试验场。
语言模型可以通过文本验证答案,世界模型却必须接受现实检验:一个动作是否安全,一次抓取是否成功,一段规划是否真正可执行。
世界模型的终局,不是让机器生成更像现实的视频,而是让机器在进入现实之前,先在自己的「内心世界」里走一遍。


登录后才可以发布评论哦
打开小程序可以发布评论哦