《科创板日报》9 月 2 日讯(编辑 宋子乔) 科幻寓言《平面国》中,主角生活在 2D 的平面世界,后被 3D 球体带入空间国,才知晓高度的存在。如今,AI 也有望迎来类似的顿悟时刻。
9 月 2 日,"AI 教母 " 李飞飞旗下创企 World Labs 发布了 " 全球首个多模态世界模型 " —— Atlas,该模型不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为 3D 世界。
Atlas 的核心能力围绕 " 理解与模拟 3D 世界 " 展开,旨在让 AI 真正理解 3D 世界的物理法则和几何结构,而不仅仅是生成看起来合理的 2D 画面,底层创新在于用 " 空间上下文 "(Spatial Context)替换 " 文本上下文 "。
不同于大模型处理文本上下文,Atlas 采用多模态自回归扩散 Transformer 架构,将输入的每一张图片和视频都锚定在三维空间中的一个精确位置,并附有相应的相机位姿和深度信息。这相当于给模型提供了一个带有 " 坐标轴 " 和 " 比例尺 " 的三维草稿本,让 AI 在理解世界时有了明确的几何和物理参考。
据 World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,并将其转化为 3D 视图。Atlas 展现出的关键能力包括:
像素级相机控制:只需 1 到 6 张图片,就能生成最长 1 分钟的 1440p 视频。更重要的是,用户可以像真正的导演一样,精确规划相机的运动轨迹,让 AI 生成连续、一致的新画面。
" 少即是多 " 的空间重建:传统 3D 重建需要成百上千张照片,而 Atlas 在稀疏视角下表现卓越。在 DTU 等公开数据集测试中,其重建误差(25.3 ‰)优于多个专用模型。在一个案例中,它仅凭 2 到 25 张地面拍摄的照片,就重建了斯坦福大学的整个主方庭,并生成了高空俯瞰的飞行路径。
" 子弹时间 " 与时空模拟:Atlas 能处理普通手机拍摄的视频,组成一套多视角拍摄系统,创造出《黑客帝国》般的 " 子弹时间 " 特效,让时间 " 冻结 " 并转换视角。
图像生成:Atlas 可根据文本描述生成图像及 360 ° 全景图,不仅能遵循复杂指令,精准呈现文字,还能驾驭丰富多样的视觉风格。
Atlas 更深远的意义,在于打通那条通往 " 具身智能 " 的路。该模型被李飞飞本人视为其团队的一个 " 里程碑式 " 成果," 这是迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门。"
可以预见,一个用 3D 视角理解现实世界的 AI,能和人类一样看待时间和空间,这将推动多个物理 AI 场景落地。
视觉特效与内容创作:创作者可以像导演一样精准地控制 AI 生成视频的每一个镜头,极大地降低了复杂运镜和难度特效的制作成本和门槛。
机器人预训练:这是 Atlas 意义最深远的一个应用。它解决了机器人训练中 " 真实数据匮乏 " 的难题。通过少量真实照片,Atlas 就能生成一个逼真的三维模拟环境以及机器人传感器会观察到的 RGB 和深度数据,让机器人在仿真世界里进行海量训练,再迁移到现实世界,效率将得到质的飞跃。
3D 内容生成:改变了 3D 场景的构建方式。以往需要昂贵设备扫描的场景,未来或许仅凭几张随手拍摄的照片就能在电脑里重建,这将为游戏设计、AR/VR 等领域带来新的可能性。
不过,值得注意的是,尽管 Atlas 展现了强大的能力,但它仍存在明显的技术边界,并非成熟的通用世界模拟器。比如它擅长构建几何连贯的静态空间,对于物体碰撞、复杂动力学的通用物理模拟能力仍待验证。当镜头转向完全未拍摄的区域时,模型依然需要进行 " 想象 ",依靠先验知识补全画面,生成的画面可能并非真实世界的精确复刻,随着生成路径变长,也可能出现局部几何漂移或纹理闪烁。
目前,Atlas 已进入早期访问阶段,仅向部分合作伙伴开放,未来它将用于驱动 World Labs 自家的 Marble 等产品。
阅 1.43W+ 特别声明:文章内容仅供参考,不构成投资建议。投资者据此操作风险自担。


