当机器人把书放进抽屉,它看到的是一串二维图像,然而真正需要完成的,却是一段发生在三维空间、持续随时间演化的动作。
书从哪里被抓起、沿什么方向移动、最终应该落到哪里——少了任何一环,视频预测可以 " 看起来合理 ",动作生成却未必真的可靠。
近年来,世界动作模型(World Action Models,WAMs)尝试把视频预测和动作生成统一起来:模型一边 " 想象 " 未来世界,一边生成机器人动作。
但大多数方法仍主要在二维像素空间中建模。对于真实机器人而言,这里始终横亘着一道鸿沟:
它看到的是 2D 投影,执行的却是 3D 交互。
为此,团队提出了4D-WAM ——一种面向 WAM、且不依赖特定模型结构的训练策略。它利用 3D 轨迹场中蕴含的空间结构与时间演化信息,在不改变原有推理架构的前提下,让模型学会理解动态三维世界。
△4D-WAM 架构,效果和可视化总览直接把 4D 特征 " 塞 " 进 WAM,为什么反而不工作?
一种看似自然的做法,是直接对齐 WAM 的中间表征与 4D 基础模型的特征。
然而,团队的前置实验给出了一个反直觉的结果:直接匹配绝对特征不仅没有稳定带来收益,反而容易造成优化冲突。
进一步分析发现,典型视觉语言动作模型(VLA)的视觉表征与 3D 特征往往具有正相关性;但在基于 DiT 的 WAM 中,中间表征与 Trace Anything 的 4D 表征在多数层上接近不相关,甚至呈负相关。
两者都在描述同一个世界,却使用了不同的 " 表征语言 "。强迫它们逐点一致,就像要求两张采用不同坐标系的地图拥有完全相同的数值。
△不同隐藏层输出与 3D/4D 重建表征的相似度
绝对表征未必兼容,但相邻帧之间 " 发生了什么变化 ",以及运动区域 " 最终去向哪里 ",应当描述同一个物理过程。
与其对齐静态数值,不如对齐动态规律。
4D-WAM:一条轨迹,两种互补监督
4D-WAM 引入Trace Anything作为教师模型。Trace Anything 提取的 3D 轨迹场能够提供良好的 4D 表征监督信号。
考虑到直接对齐绝对特征会带来优化困难,4D-WAM 在训练阶段引入了两项互补的辅助目标:
Motion Alignment:关注局部运动;
Destination Alignment:关注完整片段中的最终目标。
△Motion Alignment 与 Destination Alignment 的整体流程 Motion Alignment(运动对齐):对齐 " 如何移动 "
对于相邻两帧,4D-WAM 分别计算 WAM token 与 4D 轨迹表征的帧间差分,再在共享空间中对齐它们的变化方向。
这样,模型无需复制教师模型的绝对特征,只需学习与真实轨迹一致的运动趋势。
具体而言,对映射到共享空间并归一化后的相邻帧表征作差,即可得到每个 token 的局部运动变化:
随后,通过 token 级余弦距离对齐两种表征中的运动方向:
Destination Alignment(终点对齐):对齐 " 最终去哪里 "
只看相邻帧,模型可能擅长短时跟踪,却忽略一段操作的最终目标。
为此,4D-WAM 把首帧视为 source、末帧视为 destination,学习早期运动区域与最终目标区域之间的对应关系。这项约束为局部动作加入全局目标感知,使动作不仅准确,而且不易 " 走偏 "。
对于 source token i 与 destination token j,分别计算学生模型和教师模型的相似度:
再通过带温度系数的归一化,将相似度转化为 source-conditioned destination 分布:
通过最小化两个分布之间的 KL 散度,将教师模型的目标对应关系迁移到 WAM:
可以把它想象成一段旅程:Motion Alignment 持续告诉模型下一小段路应该怎么走;Destination Alignment 则提前明确最终目的地。两种监督相互补充,让整段轨迹更加精确。
Overall Training Objective:完整训练目标
Motion Alignment 与 Destination Alignment 均作为辅助监督加入原始 WAM 的训练过程。完整训练目标写作:
其中,与用于平衡两项辅助监督。训练结束后,这些对齐模块会被完全移除,因此不会增加推理阶段的计算开销。
4DWAM 在多任务、多场景全面提升
4D-WAM 并不重新设计 WAM 的推理架构,而是把 4D 时空知识作为一种只在训练阶段使用的辅助监督。训练结束后,4D 教师模型、投影层以及两项对齐目标都会被完全移除,部署时仍然使用原始 WAM。
这意味着,4D-WAM 在获得更强时空理解能力的同时,不增加任何推理参数量、推理延迟或显存占用。*
更重要的是,这种提升并非局限于某一个模型或某一类任务。团队在FastWAM-Joint与Lingbot-VA两种不同主干上,覆盖标准基准、七类分布外扰动、跨域随机化、未来视频预测以及真实双臂机器人任务进行了系统验证。
从 RoboTwin 2.0 的多任务操作,到 LIBERO 的空间、目标与长序列任务;从相机、背景、光照和布局变化,到真实环境中的积木插入、动态灯光抓取、扳手定位与毛巾整理,4D-WAM 都展现出了稳定且可迁移的增益。
训练时多理解一点 4D 轨迹,推理时不多付出任何代价。
常规测试:在强基线上继续向上
4D-WAM 在RoboTwin 2.0、LIBERO、LIBERO-Plus与RoboTwin Clean2Rand上进行了系统评估。结果显示,在标准测试接近饱和时,它仍能稳定提高强基线;当相机、背景、光照、噪声或布局发生变化时,提升更加显著。
△RoboTwin 2.0 与 LIBERO 标准基准实验结果
即使面对已经具备较强性能的基线模型,4D-WAM 依然能够带来稳定增益,说明 3D 轨迹监督并非只在特定场景中有效。
LIBERO-Plus:七类扰动全部提升
在相机扰动下,任务成功率从27.89%提升至45.15%,绝对提升17.26 个百分点;七类扰动的平均成功率提升8.8 个百分点。
当空间结构与观察视角发生变化时,4D 轨迹意识的价值被进一步放大。
△LIBERO-Plus 七类分布外扰动实验结果 RoboTwin Clean2Rand:更换 WAM 主干仍然有效
将同一训练策略迁移到 Lingbot-VA 后,4D-WAM 在随机化场景中的成功率由34.6%提升至41.8%,Clean/Rand 平均成功率由57.7%提升至61.7%。
这说明 4D-WAM 并不依赖单一模型结构,而是一种可迁移的对齐策略。
△RoboTwin Clean2Rand 实验结果不只是动作更准,模型 " 想象 " 的未来也更可靠
如果 4D-WAM 真正改善了时空理解,那么变化不应只出现在最终成功率上,也应体现在未来视频预测中。
为此,团队在 LIBERO-Plus 的分布外环境中,将模型预测帧与仿真器渲染的真实未来进行比较。
△分布外环境中的未来预测对比
实验结果表明,4D-WAM 不仅改善了最终动作执行,也让模型生成的未来更接近真实世界的演化过程。
从仿真走向真实机器人
团队进一步在ARX LIFT2 双臂机器人上设计了四类真实任务:
依次将四个积木插入插槽;
在转盘上抓取红色的灯;
在工具箱中抓取扳手;
整理毛巾。
这些任务覆盖了精细操作、可变形物体、长序列推理与动态目标追踪等多种真实世界挑战。
△4D-WAM 真实机器人四任务演示
在 550 条真实示范数据上联合训练后,仅经过7000 步训练,4D-WAM 的四任务平均进度由20.3%提升至31.8%,平均成功率由1.0%提升至5.5%。
尤其在积木插槽与工具箱扳手定位任务中,模型展现出更好的任务推进与完成能力。
△ARX LIFT2 真实机器人实验结果更强的 4D 感知,需要多少额外开销?
4D-WAM 的目标不是重新设计一套庞大的机器人模型,而是提供一套轻量、可迁移的训练配方。它把额外的三维感知能力留在训练阶段,不把负担带到真实部署中。
训练时:冻结 4D 教师模型,加入轻量投影层、Motion Alignment 与 Destination Alignment;
推理时:移除教师模型、投影层与全部对齐目标,保留原始 WAM 推理架构;
部署时:额外推理参数、推理延迟和显存占用均为0。
△4D-WAM 的训练效率与额外开销
在预先缓存轨迹表征(离线)的设置下,每步训练时间仅由7.3 秒增加至7.5 秒;使用 8 张 GPU 时,总训练时间由51 小时增加至52 小时;额外可训练参数的存储开销为56MiB。
也就是说,4D-WAM 仅以约2% 的总训练时间增幅,换取了跨基准、跨扰动、跨模型主干以及真实机器人任务上的持续提升;而在真正影响机器人部署效率的推理阶段,则保持零额外开销。
结语:从 " 预测像素 " 到 " 理解轨迹 "
对于机器人而言,一个可信的世界模型不能只生成视觉上合理的未来,还需要理解:
物体如何穿过三维空间;
交互关系如何随时间变化;
一段操作最终要抵达什么状态。
4D-WAM 的出发点很简单:让模型少记一点绝对表征,多理解一点动态规律。
通过 Motion Alignment 与 Destination Alignment,WAM 在训练阶段获得了对运动与目标的双重感知,并在不增加推理负担的情况下,将这种能力带入动作生成。
从 " 预测像素 " 到 " 理解轨迹 ",也许正是世界动作模型走向可靠机器人智能的一步。
论文链接:https://arxiv.org/abs/2608.08023
代码链接:github.com/lishanyqy/4DWAM
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦