
编译 | 王涵
编辑 | 心缘
智东西 9 月 2 日消息,今天凌晨,"AI 教母 " 李飞飞的世界模型创企 World labs 发布新一代世界模型 Atlas。

Atlas 可以借助这一上下文来预测后续内容,在三维空间中与已见信息保持连贯一致,并能推想视野之外的景象。同时,Atlas 遵循 Scaling Law,其性能会随训练计算量的增加而稳步提升。
Atlas 可执行世界生成、重建和模拟等任务,具体能力如下:
1、摄像机控制生成:
Atlas 可以根据一张或多张图像生成图像和视频,支持像素级精准的摄像机控制,可输出长达一分钟、分辨率高达 1440p 的视频内容。
2、空间重建:
Atlas 可以依据一至数十张输入图像,即可重建真实世界的三维场景。它既能生成新视角下的图像帧,也能输出显式的 3D 数据,其表现甚至超越了专攻三维重建的顶尖模型。
3、时空模拟:
Atlas 可基于输入视频对空间与时间进行联合建模,可对视频进行重新构图,同时为机器人领域开启 " 真实到模拟 " 的工作流程。
4、图像生成:
Atlas 可根据文本描述生成图像及 360 ° 全景图,不仅能遵循复杂指令,精准呈现文字,还能驾驭丰富多样的视觉风格。

一、可以想象摄像机后方场景,还能生成 360 ° 全景图
在摄像机控制方面,Atlas 能够根据一张或多张参考图像,在用户指定的任意摄像机位置和角度生成全新的视角。生成的画面与输入图像的内容和几何结构严格匹配,并且可以平滑地向外推演,补全输入中未能呈现的场景部分。
例如,Atlas 可驾驭多种场景类型、视觉风格和摄像机运动轨迹。
Atlas 还可以将摄像机几何参数作为原生输入类型,用户能够精准地构图每一帧画面,掌控每一个运动细节。
例如,Atlas 仅凭一张输入图像即可生成完整的场景。它利用输入图像的内容,结合自身世界知识,想象出场景在新视角下应有的样貌。
与大型语言模型类似,Atlas 会先将输入编码为上下文,再基于该上下文生成输出。但其的独特之处在于,用户输入的每张图像都会被锚定在空间中的某个三维位置,由此构成一个空间上下文。
例如,用户可以将两张毫无关联的参考图像放入上下文中,在三维空间里分别指定它们的位置,Atlas 便能生成一个在二者之间平滑过渡的世界。
Atlas 还可以将摄像机运动控制与空间上下文管理相结合,成精准可控的长视频。每个场景、每个镜头角度都由用户设计。
例如,用户可以仅凭少量参考图像,生成分辨率为 1440p、时长一分钟的视频。用户可以手动设计一条穿越场景的摄像机路径,Atlas 将据此生成一个连贯一致的世界。
Atlas 的主要定位是世界建模,但它同样能够根据文本提示生成图像,支持复杂指令、文字渲染以及多种视觉风格。
此外,Atlas 也可以根据文本或图像输入生成360 ° 全景图,覆盖多种场景类型和风格。
二、2 张图就能重建三维空间,能根据地面图片生成鸟瞰图
在空间重建方面,World Labs 团队认为,Atlas 在" 基于稀疏输入图像的新视角合成 ",这一三维计算机视觉领域数十年来未破的基础性难题的解决上,有了初步的进展。
在实际体验中,用户可以自由选择输入视角图像的数量。如果输入图像中某些区域不可见,Atlas 会借助其世界知识,以合理的方式补全缺失内容。
当然,用户也可以选择关闭 " 想象 " 模式,进行精确重建。Atlas 的空间上下文最多可容纳上百张输入图像,支持用户对真实环境进行高保真复现。
例如,Atlas 可以仅凭一张地面拍摄的照片,就生成该场景的鸟瞰图。输入照片中可见的花园在模型输出中得到了精准还原,场景其余部分则是模型想象出来的。
在添加第二张房屋图像后,模型输出同时呈现了花园和房屋,但左侧的房屋仍是想象的产物。在加入第三张主楼的输入图像后,Atlas 便生成了整个场景。
再比如,World Labs 团队逐步构建了斯坦福大学主方庭的场景——从绿草如茵的正门入口开始,直至纪念教堂外墙上五彩斑斓的马赛克装饰。
整个过程 Atlas 只接收了25 张从地面拍摄的图像,它就能直接生成从校园上空远距离俯瞰的飞行路径画面。
面对同一场景,Atlas 能够生成多条不同的运动轨迹。无论用户如何调整摄像机路径,场景始终保持连贯一致。
例如,基于少量输入图像,Atlas 可以生成多条穿越同一场景的摄像机路径。不同路径可分别突出场景的不同部分,用户也可以调整画面的速度、长度或复杂度。
前述示例中,Atlas 输出的是二维图像与视频。但在机器人、游戏、设计、视觉特效等领域,工作流往往需要显式的三维输出。
Atlas原生支持二维图像帧与三维深度图的双重处理,能够将生成的世界以点云或 3D 高斯泼溅的形式输出。
从一张图像出发,Atlas 可以生成新视角并估算三维几何,进而转换为 3D 高斯泼溅。若用户输入的是真实空间的视频,模型则会预测每一帧的深度,并将其整合为三维重建。
Atlas 还会填补点云中的剩余空缺,将其转化为完整的高斯泼溅场景,并在设备端以高分辨率、高帧率进行渲染。
三、三个机位模拟 " 子弹时间 ",还能模拟机器人导航
Atlas 本身就是一个世界模拟器,它既理解世界的空间结构,也懂得世界随时间如何演变。将空间能力与时间能力融合在一起,Atlas 便可以应用于视觉特效、机器人等领域。
有了 Atlas,几台普通摄像机就能摇身一变,组成一套" 子弹时间 " 式多视角拍摄系统。只需三台摄像机同步录制的画面,Atlas 就能让时间定格,并任意调整镜头角度。
同时,在机器人仿真领域,Atlas 为导航与操作类任务的 " 真实到模拟 " 规模化扩展提供了新的选择。
当模拟机器人在该空间中移动时,Atlas 会同步生成其传感器沿途理应观测到的 RGB 图像与深度数据。
例如,World Labs 团队用手机拍摄了两个大型环境,各取 24 帧画面用于重建。团队模拟了不同类型机器人在场景中沿不同路径行进,并由 Atlas 从机器人身上搭载的摄像机视角生成实时画面。
在操作类任务上,只需几段随意录制的视频,Atlas 就能帮助构建一个可捕捉物体运动与交互的仿真环境。
任务模拟完成后,用户可以改变各种变量,如替换物体、调整位置、改变机器人动作、更换光照或背景等,为机器人规模化训练提供多样化的数据与测试环境。
四、融合 LLM 与扩散模型优势,摄像机指令遵循度、重建精度均超专用模型
Atlas 采用全新统一架构,以空间控制为核心,融合多模态处理、自回归生成、扩散模型与 Transformer 骨干网络。
该架构原生支持文本、图像、相机位姿及 3D 深度图,视频以图像序列形式输入。Atlas 通过逐一生成序列元素(每个元素依赖前序信息)实现输出,并采用逐步去噪方式生成高质量图像与视频等高维连续数据。Transformer 结构则保证了模型与现代硬件的适配。

摄像机控制对比中,Atlas 原生支持相机参数编码路径,其他模型则需通过文本描述(如平移、推轨等电影术语)来指示。测试结果显示,Atlas 对摄像机指令的遵循度更高,且在复杂轨迹下优势更明显。


Atlas 的发布,标志着 World Labs 在空间智能领域迈出了实质性的一步。
与过往侧重单一模态或特定任务的模型不同,Atlas 从设计之初便以空间为核心,将多模态理解、三维重建、时空模拟与生成能力融于一体,构建了一个可扩展的世界模型底座。
从技术路径来看,这种统一架构不仅降低了多任务部署的复杂度,也为后续与机器人、VFX、游戏等行业的结合预留了接口。


登录后才可以发布评论哦
打开小程序可以发布评论哦