「全球首个」多模态世界模型,来了!
来自李飞飞 World Labs。
World Labs 对这个名为Atlas的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan 也明确强调出,这一次,可不只是生成一段可互动视频了哟:
建模世界,移动相机,模拟空间和时间。
就是说,Atlas 能够以像素级的相机控制生成图像和视频帧,并完成 3D 重建。并且空间和时间都能理解。
李飞飞本人将其视作 World Labs 的「里程碑式」成果,直接一手置顶:
Atlas 为从视觉特效到机器人的众多应用场景打开了大门。
飞飞高徒、英伟达机器人主管 Jim Fan 也来捧场,指出:这是机器人领域 Real-to-Sim 的一大步。
具体来说,Atlas 是一个多模态自回归扩散 Transformer,它的能力包括:
相机控制生成:仅需一张图片,Atlas 即可生成具有像素级相机控制的图片和视频,最高可输出 1 分钟、1440p 的视频。
空间重建:Atlas 可以基于一张到数十张输入图像,重建真实世界场景。既可以生成新视角下的图像帧,也能输出显式 3D 表示,其效果超过当前专门针对 3D 重建训练的最先进模型。
时空模拟:Atlas 可以根据输入视频同时建模空间和时间,可以转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人 Real-to-Sim 工作流。
图像生成:Atlas 可以根据文本生成图片和 360 ° 全景图,能够遵循复杂 Prompt、准确渲染文字,并生成大量不同的视觉风格。
对于机器人模拟,仅需喂 Atlas 几张照片,它就能生成逼真的 RGB 和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。
从头训练的多模态世界模型
技术细节上,Atlas 是一个全能模型(omni model)。
它的目标,是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据。
与此同时,空间控制是整个模型的核心。
为了实现这些目标,李飞飞团队设计了一种全新的基础架构,来作为未来世界模型的基础——多模态自回归扩散 Transformer。
文本、图像、视频、3D 数据……各种输入都会被锚定在三维空间中,从而形成一个空间上下文。
然后,Atlas 会根据这个上下文生成多模态输出。
这样一来,比如把两张毫无关系的参考图片放进同一个上下文中,再分别指定它们在 3D 空间中的位置,Atlas 就能把它们缝合成一个空间自然、连续的世界。
更具体地拆解一下,多模态,指的是 Atlas 可以原生处理多种不同的数据类型,包括文本、图像、相机位姿、3D 深度图等。
视频则被表示为图像序列。
每一张图像和每一幅深度图,都对应一个明确的相机位姿。
自回归,指 Atlas 操作的是一系列元素组成的序列,序列中的每一个元素都可以属于前面提到的某一种数据模态。
Atlas 每次生成一个新的输出,都会以前面已经存在的序列内容作为条件。
这种灵活的设计天然适用于各种不同任务。
每一种任务,本质上都只是一种不同类型的序列——前面是输入,后面是输出。
扩散模型,指 Atlas 是一个 Rectified Flow(校正流)模型,通过逐步去噪来生成输出。
扩散模型尤其擅长对图片和视频这种高维连续数据进行建模。同时,在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。
而Transformer不必多说,在世界模型领域,Transformer 也被证明是非常稳健的基础架构。
也就是说,Atlas 实际上融合了大语言模型和视频模型中的大量思想。
Atlas 既可以利用大量原本服务于 LLM 推理和加速的技术,包括 KV Cache、缓存感知路由、解耦式服务等等。
另一方面,它又和现代图像、视频生成模型一样,是一个潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法,并引入更先进的 VAE 架构。
研究团队在相机控制生成和 3D 重建两个关键任务上对这个新一代世界模型进行了定量评估。
在相机控制生成上,结果显示,Atlas 优于 SOTA 视频模型。
并且相机轨迹越复杂,Atlas 的优势越大。
在根据稀疏输入视角进行 3D 重建的任务中,Atlas 同样超过了表现最好的专业开源 3D 重建模型。(分数越低表现越好)
值得一提的是,Atlas 从设计之初就为 Scaling 做好了准备。
李飞飞团队表示,已经看到了非常有利的证据,证明Atlas 的能力会随着规模扩大而继续提高。
目前,Atlas 正在向部分合作伙伴开放早期访问。
也可以在官网申请访问权限。
具身智能 Real-to-Sim 的关键一步
李飞飞新世界模型一出,关注的焦点,还是汇聚在具身智能上。
把今年 World Labs 的动作联系起来,Atlas 的意义也更加明朗。
今年 6 月,李飞飞亲自下场定义世界模型,将其分类为渲染器、模拟器、规划器。
并明确指出,「最关键的是模拟器」。
因为模拟器承担的是世界本身的几何、物理和动力学,是渲染和行动共同依赖的基础。
紧接着,7 月 21 日,World Labs 收购机器人仿真公司 SceniX。
7 月 28 日,公开 Real-to-Sim-to-Real 系统,强调机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验。
现在,Atlas 来了。
从真实照片 / 视频,到 3D 空间,再到机器人传感器视图和可变化的模拟环境,这一条路径被打通了。
World Labs 官方表示,接下来,Atlas 会成为未来版 Marble 以及 World Labs 其他产品的底层模型。
参考链接:
https://www.worldlabs.ai/blog/atlas
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦