
今天,李飞飞创办的空间智能公司 World Labs 发布了新一代世界模型 Atlas。World Labs 在社交平台上将其称为 " 全球首个多模态世界模型 ",希望用同一个基础模型同时完成视频生成、3D 重建和时空模拟。
和目前主流的视频生成模型不同,Atlas 并不是在现有视频或 3D 模型上继续改造而来。World Labs 从零开始对它进行预训练,让文本、图像、视频和 3D 数据从训练起步阶段就进入同一个模型,并尝试把这些不同形式的信息统一理解为同一个三维空间。

(来源:X)
基于这个空间,它既可以从一张照片生成新的视角,也可以按照给定的镜头轨迹生成最长 1 分钟、1440p 的视频,还能将照片和视频重新构建成点云和 3D 高斯泼溅(Gaussian Splatting)场景,进一步用于影视制作、游戏以及机器人仿真。
Atlas 目前已经向少数合作伙伴开放早期测试,未来也会成为 World Labs 旗下 3D 世界生成产品 Marble 的底层模型。
这也是 World Labs 成立两年以来最重要的一次基础模型发布。这家公司由李飞飞与 Justin Johnson、Christoph Lassner、Ben Mildenhall 共同创立,后几位分别来自计算机视觉、生成式 AI 和计算机图形学领域。
2024 年,World Labs 以 2.3 亿美元融资正式走出隐身模式;今年 2 月,公司又完成 10 亿美元新融资,其中 Autodesk 投资 2 亿美元,AMD、英伟达和 Fidelity 等也参与其中。
过去两年,World Labs 一直在强调一个判断:语言模型让机器学会了处理 " 文字 ",下一步则需要让 AI 真正理解 " 空间 "。
一个模型,同时生成视频和重建 3D 世界
Atlas 最核心的变化,是把相机在三维空间中的位置和姿态直接变成模型的一种原生输入。
普通视频模型接受 " 镜头向左移动 "" 绕着物体旋转 " 等自然语言指令后,本质上仍然是在像素空间里猜测后续画面。Atlas 则会把每一张输入图像与对应的相机位置绑定起来,放进一个共享的 Spatial Context(空间上下文)。
对于这个能力,我们可以简单理解为:模型不仅知道 " 这张照片里有什么 ",还知道 " 这张照片是从空间中的哪里拍出来的 "。
因此,当用户移动摄像机时,Atlas 要做的不只是生成另一张看起来合理的图片,还要尽量让新的画面与此前观察到的空间结构保持一致。对于原图中没有出现的区域,模型再利用自身的世界知识补全。World Labs 展示的例子中,只给 Atlas 一张机器人的正面照片,再把镜头绕到背后,模型能够生成此前完全没有出现在输入中的机器人背面以及周围环境。
(来源:World Labs)
这种机制也让 Atlas 获得了比普通视频模型精细得多的运镜控制。
World Labs 在社交平台展示的一段视频中,团队只提供了 7 张参考图,然后人工设计了一整条相机轨迹,Atlas 最终生成了一段 1 分钟、1440p 的连续视频。镜头可以在复杂场景中前进、旋转、转向,而不是只能依赖一句 " 航拍 "" 推进镜头 " 来碰运气。
World Labs 还做了一组相机控制测试。Atlas 与 Seedance 2.5、FLUX 3、Gemini Omni Flash 等模型分别按照指定镜头轨迹生成视频,再由第三方标注者判断哪一段更符合预定运镜。在与 Seedance 2.5 的对比中,94% 的评审选择了 Atlas;与 Gemini Omni Flash 对比时,这一比例为 81%。
不过这组测试也有一个需要注意的地方:Atlas 可以直接读取精确的相机轨迹,而其他视频模型并不支持这种输入,因此 World Labs 只能把相同的镜头运动转换成文字提示。这实际上既体现了 Atlas 的优势,也意味着它并不是完全同条件的纯视频质量比较。
Atlas 的第二项能力则更接近传统计算机视觉:从稀疏图片重新构建 3D 世界。
一张照片也可以完成,但需注意,这里的 " 重建 " 并不代表照片之外的部分是真实的。
World Labs 展示了一个案例。第一次只输入一张花园照片时,Atlas 能从空中重新观察这个花园,但花园以外的房屋和环境基本都是模型根据常识 " 想象 " 出来的;加入第二张小屋照片后,小屋的位置开始与真实环境对应;再加入第三张主屋照片后,整个空间才进一步接近实际场景。
World Labs 将这套机制概括为:模型看到得越多,需要想象的就越少。通常两三张图片已经可以得到较为忠实的重建,而 Atlas 最多也能利用超过 100 张图片作为空间上下文。
图|输入一张花园照片时,Atlas 会自行补全没有被相机看到的区域;随着小屋、主屋等更多视角加入,模型的 " 想象 " 逐渐被真实信息替代,重建结果越来越接近实际空间。(来源:World Labs)
更重要的是,它得到的并不只有一段 " 看起来像 3D" 的视频。
Atlas 可以同时预测每一帧的深度,把结果组合成点云,并进一步生成 3D 高斯泼溅场景。后者可以直接在本地以较高帧率渲染,也是 World Labs 目前 Marble 产品使用的 3D 表示形式。这代表着同一个模型生成的结果,可以进一步进入游戏、VFX、建筑设计等现有 3D 工作流。
几部手机,为机器人重建真实世界
如果说前两项能力主要解决的是空间,Atlas 更进一步的目标则是把时间也放进世界模型。
World Labs 展示了一个类似《黑客帝国》" 子弹时间 " 的案例。
传统的多视角自由视点视频,通常需要大量同步摄像机和专门的拍摄系统。World Labs 的研究人员只使用 3 — 5 台普通手机或运动相机,从几个方向同时拍摄动态事件。Atlas 将这些视角重新对齐并建立空间模型后,用户可以在事件已经发生以后,再从现实中根本不存在的摄影机位置观看同一个瞬间。

而这项能力最终指向的,不只有影视制作。World Labs 同时展示了 Atlas 在机器人 Real-to-Sim (真实到仿真)中的应用。
研究人员首先用手机视频拍摄两个真实环境,分别从视频中选取 24 帧完成空间重建;随后让不同形态的机器人沿着任意路径在这个虚拟空间中移动。除了重建环境本身,Atlas 还会根据机器人的位置,生成其机载摄像头应该观察到的 RGB 图像和深度数据。
随着机器人在其中移动,它还需要持续获得与当前位置对应的视觉和深度观测。Atlas 希望把这两件事交给同一个模型完成:既重建机器人所在的世界,也生成机器人在这个世界中 " 看到 " 的内容。
World Labs 还展示了进一步面向机器人操作的实验。通过少量真实世界录像,Atlas 可以辅助建立包含物体运动和交互的模拟场景,包括刚体、带关节物体以及可变形物体。完成模拟后,研究人员还可以改变物体及其位置、机器人动作、光照和背景,从同一个真实任务中扩展出更多训练和测试环境。
过去如果想把一家真实工厂、一间仓库或者一套住宅转化成可用于机器人模拟的环境,往往需要更复杂的扫描和建模设备。World Labs 希望借助世界模型,把其中相当一部分过程压缩成普通手机就能够完成的数据采集。
Atlas 之所以能够在视频生成、3D 重建和机器人模拟之间切换,也与它的底层架构有关。
Atlas 是一个多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer)。和普通视频模型不同,文本、图像、相机位姿和 3D 深度图等不同信息都会被放进同一个序列中,每一张图像和深度图还会与明确的相机位置绑定,由此组成一个共享的 Spatial Context。
在生成过程中,Atlas 又结合了两套我们已经熟悉的技术路线:一方面,它像语言模型一样采用自回归方式,根据此前的上下文逐个生成新的元素;另一方面,它又像现代图像和视频模型一样,通过扩散模型的逐步去噪处理高维视觉信息。

图|Atlas 的统一模型架构。文本、图像及其相机位姿共同组成 Spatial Context,模型可以在同一架构中输出图像、视频和深度信息。(来源:World Labs)
世界模型正在从 " 生成画面 " 走向 " 建立空间 "
Atlas 不是过去一年出现的第一个世界模型。
2025 年 8 月,Google DeepMind 发布 Genie 3,可以从文本实时生成 720p、20 — 24fps 的交互式环境,并在几分钟内维持基本的一致性;去年 11 月,World Labs 自己推出的 Marble 已经可以接受文本、图片、视频和粗略 3D 布局,生成可自由探索和导出的 3D 世界;今年 6 月,英伟达又推出 Cosmos 3,用统一架构处理语言、图像、视频、声音和机器人动作,将世界模拟进一步延伸到 Physical AI。
因此,如果严格按照行业定义来看," 全球首个多模态世界模型 " 其实并不是一个没有争议的说法。World Labs 自己此前就将 Marble 称为多模态世界模型,英伟达也将 Cosmos 3 称为全模态世界模型(omnimodal world model)。
Atlas 更值得关注的地方,是把过去相对分离的生成、重建和模拟任务,进一步放进了一个以 3D 空间为核心的统一基础模型里。
今年 6 月,李飞飞和 World Labs 曾经把现阶段的世界模型分成三类:负责产生视觉画面的 Renderer(渲染器)、负责建立几何结构和物理环境的 Simulator(模拟器),以及负责决定智能体下一步行动的 Planner(规划器)。他们当时提出,最终目标应该是让这三个方向重新汇合到一个统一的世界模型中。
Atlas 显然是朝这个方向迈出的一步:它已经开始同时承担渲染器和模拟器的部分工作。但距离真正能够 " 模拟现实世界 ",它仍然有明显距离。
目前 Atlas 公布的机器人案例主要证明了空间重建、视觉观测生成和简单物体交互能力,World Labs 尚未公布它在碰撞、摩擦、材料特性、复杂动力学以及长时间物理演化上的系统性测试,也没有证明由 Atlas 生成的模拟环境能够稳定提高机器人策略在真实世界中的成功率。
世界模型用于机器人训练时,最危险的问题恰恰是一个视觉上完全合理的世界,在物理上却可能是错误的。相关研究者也一直将 sim-to-real gap 视为这类技术必须解决的核心问题。
与此同时,Atlas 目前还没有公开模型参数规模、训练数据量和训练算力,也没有发布权重;它刚刚进入少量合作伙伴的早期测试阶段,目前的能力和 benchmark 主要来自 World Labs 自己公布的结果,还缺少独立测试。
因此,Atlas 现在还不能被简单理解成一个已经能够 " 预测现实 " 的物理世界模拟器。
但它展现出了一条越来越明确的技术路线:过去的生成模型学习如何根据已有像素预测下一帧,而世界模型正在尝试回答一个更复杂的问题——如果摄像机移动到世界中的另一个位置,会看到什么;如果一个物体或机器人在这个世界里开始运动,接下来又会发生什么。
参考链接:
1.https://www.worldlabs.ai/blog/atlas
2.https://www.worldlabs.ai/atlas
3.https://www.worldlabs.ai/blog/marble-world-model
4.https://www.worldlabs.ai/blog/taxonomy-of-world-models
5.https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/
6.https://www.nvidia.com/en-us/ai/cosmos/
运营 / 排版:何晨龙
注:封面 / 首图由 AI 辅助生成


登录后才可以发布评论哦
打开小程序可以发布评论哦