VAST,香港大学和 PICO开源了一个双目世界模型——StereoWorld。
与现有 " 先生成单目视频,再估计深度、变换视角并修补遮挡 " 的多阶段方案不同,StereoWorld 从生成开始便同时建模左右视图,使视觉外观与双目几何在同一模型中共同演化。
更重要的是,StereoWorld 的训练不依赖显式深度监督。模型仅使用 RGB 双目视频,便能从左右视图之间的视差中学习稳定的几何关系。
世界模型看起来很真实,为什么仍然不够 " 懂三维 "?
近年来,视频生成模型已经能够合成高度逼真的动态画面,进一步加入相机轨迹或动作指令后,模型还可以向前移动、转向或探索新的视角,因此逐渐具备了 " 世界模型 " 的雏形。但大多数现有世界模型仍然通过单目 RGB 视频表示世界。
单张图像并不能唯一确定三维结构,同一个物体究竟是 " 体积很小但距离很近 ",还是 " 体积很大但距离很远 ",在二维画面中可能产生相同的投影。因此,单目模型中的深度通常是隐式且尺度不确定的。当相机持续移动时,这种不确定性还可能不断累积,最终表现为空间结构漂移、物体形状改变,甚至凭空出现原本不存在的内容。
另一类方法会额外生成深度图,构建 RGB-D 世界模型。但深度图与大规模 RGB 视频预训练模型之间还存在明显的模态差异;与此同时,由于误差累积,使用单目得到的 depth warp 后再 inpaint 得到 novel view 的方法往往会丢失视频中的细节信息(如下图中的铁丝网)。
△左:单目 depth warp+inpaint;右:StereoWorld 双目生成
双目视觉则提供了另一条路径。人类通过左右眼观察到的细微位置差异感知距离,当相机焦距和双目基线已知时,视差可以直接关联到真实尺度下的深度。因此,双目图像不仅多提供了一张画面,更为模型提供了一个稳定的三维 " 物理锚点 "。
StereoWorld 的出发点正是:与其让世界模型在生成完成后再猜测深度,不如让它从一开始就用 " 双眼 " 观察和生成世界。
双目视频生成
给定单张图像、场景文本描述,以及 WASD 键控制的平移和上下左右键控制的方向,StereoWorld 通过统一建模相机与视频帧 RoPE 编码的方式,同时生成后续的左眼视频和右眼视频。结果如下:
从固定水平基线,扩展到灵活的双相机运动
在最初的双目生成设置中,StereoWorld 主要面向标准的校正双目相机:左右相机保持固定的水平基线,并沿着相同轨迹同步运动。在进一步拓展中,研究团队发现,StereoWorld 并没有被限制在这一固定相机配置中。得益于统一的 Camera-Frame RoPE 对相机内外参及相对位姿的显式建模,模型能够进一步支持相对关系随时间变化的双相机轨迹。
在新的 Flexible Stereo 模式下,左右相机不再需要始终保持固定、平行的水平关系,而可以具有相对独立的运动轨迹。例如:
左右相机可以从初始基线状态逐步汇聚;
右相机可以相对左相机产生水平方向的位移;
两台相机之间可以出现竖直方向的高度差;
右相机还可以沿前后方向移动,形成深度方向的相对偏移。
结果如下:
自回归长视频生成
原始 StereoWorld 采用双向注意力,一次生成的视频长度受到 81 帧限制,研究团队进一步将其蒸馏为四步生成的因果自回归模型,并为左右视图分别维护带有相机位置编码的 KV Cache。蒸馏后的模型能够生成约 10 秒的双目视频,速度从 0.25 FPS 提升至约 3 FPS,速度提升约 10 倍,为长时、交互式立体世界生成提供了初步基础。下面展示了蒸馏后的模型在长时视频推理的结果:
从 " 双目同时生成 " 到 " 给定左视频,补全右视频 "
更进一步,研究团队发现,StereoWorld 不仅可以从初始画面出发,同时生成左右两路视频,还可以迁移到另一种推理模式:给定一段完整的左视图视频,以及另一条目标相机轨迹,由模型补全对应的右视图视频。
这是 StereoWorld 所学习的双目联合分布自然导出的条件生成能力。从概率建模的角度,可以将 StereoWorld 学习的目标概括为:,其中和分别表示左右视图视频,和表示对应的相机轨迹。在双目同时生成时,模型从这一联合分布中同时采样左右视频;而当左视频已知时,同一个联合分布可以自然转化为:,也就是:在给定左视图内容和两条相机轨迹的条件下,生成与之匹配的右视图视频。结果如下:
△左:Reference Video;中:Inpainted View 1;右:Inpainted View 2展望
此次开源版本展现出的灵活双相机控制与跨视图补全能力说明,StereoWorld 的双目联合生成学习到的并非某一种固定视差模式,而是相机运动、场景内容与跨视图几何之间更一般的联合分布关系。沿着这一方向,StereoWorld 有望能够从双相机扩展到更加自由的多视角配置,比如支持数量不固定的相机或更复杂的相对轨迹;另一方面,view inpainting 的能力也有望将大规模单目视频资源转化为可控的立体或多视角内容,并服务于 VR/AR、虚拟摄影和沉浸式内容创作。
* 该开源模型主要基于研究团队在 CVPR 2026 上发表的工作 Stereo World Model。
代码:https://github.com/VAST-AI-Research/StereoWorld
项目主页:https://sunyangtian.github.io/StereoWorld-web/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦