小扎科技 2小时前
迈向原生世界状态的统一多模态世界模型,大晓机器人联合南洋理工大学S-Lab发布Puffin-World
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

近日,大晓机器人联合南洋理工大学 S-Lab 等机构发布并开源统一多模态世界模型框架 Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World 首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。

Puffin-World 同步开源代码、模型和 Puffin-16M 数据集,包括 1500 万组视觉—语言—相机三元组和 100 万条具有挑战性的旋转轨迹,并开放覆盖 28 个公开数据集、约 4450 万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。

针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

项目链接:https://kangliao929.github.io/projects/puffin-world/

代码链接:https://github.com/KangLiao929/Puffin

Arxiv 链接:https://arxiv.org/abs/2609.04196

Hugging Face 链接:https://huggingface.co/blog/KangLiao/puffin-world

统一构建三种原生状态——物理、几何与外观

Puffin-World 从三维世界状态本身出发,将其建模为三种相互关联的原生状态:

物理状态:描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图。

几何状态:通过深度信息表达场景的三维结构、空间远近和表面关系。

外观状态:对应相机最终观察到的 RGB 图像。

三种状态共同构成从 " 世界如何存在 " 到 " 世界如何被交互 " 的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。

为统一绝对方向和跨视角运动,Puffin-World 提出 Omni-Camera 相机表示,将重力锚定的绝对相机信息与基于射线的相对几何结合起来。模型先从参考图像中精确理解相机的横滚角、俯仰角和视场角,再通过物理传播机制,将参考视角中的重力信息传递至后续视角。

即使相机经历连续旋转和长轨迹移动,整个生成过程也拥有一个稳定的物理参照系。地平线不会随意漂移,场景的上下关系不会在运动中失真,生成视角与目标相机轨迹也能保持一致。

Puffin-World 还在同一次生成过程中联合输出 RGB 外观和深度几何,使生成结果能够直接用于三维重建,而不必在视频生成之后再依赖独立的深度估计模块补充空间结构。由此,世界生成与世界重建不再是前后割裂的两个步骤,而成为同一个状态预测过程。

一个模型完成四件事,从理解世界走向闭环探索

Puffin-World 可以在一个模型中统一四类过去往往需要不同系统分别完成的任务。

第一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别 " 图中有什么 ",还理解 " 当前视角以怎样的姿态看到了它 "。

第二,自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。

第三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。

第四,闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成 " 状态感知—动作预测—结果生成—再次校准 " 的闭环,高效扮演 World Action Model ( WAM)角色。技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。

这四类能力并非四个模型的简单拼接,而是由同一套视觉、语言、相机和世界状态表征共同支撑。任务的变化不再依赖切换系统,而由输入内容、相机条件和视图角色决定。这种统一性,使 Puffin-World 更接近机器人从感知、推理到行动的完整工作链路。

1600万核心数据与4450万开放标注,扩大世界模型训练底座

世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。为此,团队构建了 Puffin-16M 数据集,包含两个组成部分。

Puffin-Cam-15M 提供 1500 万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。

Puffin-Traj-1M 则提供 100 万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及 360 度环视等复杂情况,重点补足传统三维数据集在大幅旋转和长轨迹探索方面的不足。

与主要描述视角之间相对变化的数据不同,Puffin-16M 进一步引入相机相对于重力和真实世界的绝对方向。模型不仅学习 " 相机从上一帧移动了多少 ",还要理解 " 相机当前在世界中处于什么方向 "。

除自建数据集外,团队还利用 Puffin-World 精准的物理世界感知能力为 28 个公开数据集补充绝对相机位姿标注,覆盖约 4450 万张图片,包括 ImageNet、CC12M、Objects365、ScanNet、DL3DV 和 GPIC 等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。

更重要的是,Puffin-World 同步开放代码、模型和数据集。开源的不只是一个算法实现,而是一套从数据、标注、训练到评测的完整技术链路,使研究机构和产业开发者可以围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能开展后续开发。

四项SOTA,从相机理解到三维生成

Puffin-World 的统一能力在四项 Benchmark 中取得 SOTA 成绩。

在相机到真实世界理解任务上,Puffin-World 在 Stanford2D3D、MegaDepth、TartanAir 和 LaMAR 四个公开基准上取得最佳或并列最佳的中位误差,并在大多数 AUC 指标上领先。

其中,在 Stanford2D3D 上,Puffin-World 对横滚角、俯仰角和垂直视场角的中位误差分别为 0.29 度、0.53 度和 1.62 度,显示出较强的绝对相机理解能力。

在相机可控生成基准 Puffin-Cam-Bench 上,模型生成结果的上方向、纬度和重力方向中位误差分别为 0.84 度、1.26 度和 0.79 度,FID 为 75.93,均优于参与比较的通用图像生成模型和已有相机可控生成方法。这意味着 Puffin-World 不仅能够生成质量较高的图像,还能让生成画面准确服从指定的相机状态。

在 Puffin-Traj-Bench 上,Puffin-World 取得 18.00 的 PSNR、0.613 的 SSIM 和 0.288 的 LPIPS;生成轨迹的横滚角、俯仰角和视场角中位误差分别为 0.80 度、1.10 度和 2.96 度。其中,PSNR、LPIPS 以及三项相机控制误差均取得最优结果。

在 RealEstate10K 三维世界生成测试中,Puffin-World 取得 17.22 的 PSNR、0.595 的 SSIM 和 0.318 的 LPIPS,三项视觉一致性指标均优于对比方法。

这些结果表明,Puffin-World 并非只在单一任务上提高图像质量,而是在相机物理理解、灵活空间控制、几何一致性生成和三维重建之间建立了相互支撑的统一能力。

从 " 生成一段看起来合理的视频 ",到 " 预测一个具有物理、几何和外观一致性的世界状态 ",Puffin-World 推动世界模型从视觉内容生成进一步走向可感知、可校准、可探索和可重建的三维环境。这也是世界模型真正进入机器人训练与具身智能应用所需要完成的一次范式转变。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 物理 南洋理工大学 开源 abs
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论