一张新榜单能证明什么,又不能证明什么。
作者|七月
假设一台双臂机器人正在把罐子放进锅里。
头部相机显示任务已经完成,左腕画面里的罐子却还留在夹爪中;右腕画面里,另一只机械臂甚至出现了不该发生的移动。三段视频分开看都足够流畅,合在一起,物理世界却裂成了三份。
机器人不会被一段好看的视频安抚,它必须在同一个世界里行动。
这正是 TriWorldBench(首个面向机器人三视角视频生成与理解的具身世界模型评测基准)想解决的问题。过去,机器人世界模型的评测往往盯着单一外部视角,看画面是否清晰、连贯、接近参考视频。TriWorldBench 同时检查头部、左腕和右腕三个视角,要求它们描述同一次操作、同一个物体状态和同一段动作进程。它还把任务完成度、接触合理性、轨迹、时间稳定性和视觉质量放进同一套评测里。
就在最近,TriWorldBench 更新了他们榜单的排名,Aether AI 最新发布的首个因果世界模型—— CausalWM 以 66.04 的高分登顶榜首。
图源:Aether AI 创始人黄碧薇 X 账号官宣发布 CausalWM
除了在聚焦机器人三视角一致性的 TriWorldBench 上取得第一,CWM 还在覆盖更广泛物理场景的 Physical AI Bench(PAI-Bench)中获得验证。
在接收到一个观察结果和语言指令后,因果工作记忆系统会通过明确的运动和几何预测来生成未来的情景 图源:Aether AI 官网
第一名的成绩当然值得欣喜。但身处世界模型这样一个定义仍在快速变化的赛道,对 Aether AI 来说更重要的问题或许是:这 66.04 分究竟测到了什么?
1. 第一名的背后
Aether AI 的此次发布,带来了模型机制和榜单成绩两项公开信息。
CausalWM(下文简称 CWM)是一个 16B 的模型。给定当前观测,并结合语言指令或机器人动作条件,CWM 先预测光流,再生成三维点图(pointmap),最后生成未来 RGB 视频。前一步的结果会成为后一步的上下文,后续信息则由注意力掩码挡住,不能提前 " 泄题 "。Aether AI 团队把这套顺序预测机制称为 Causal CoT(因果思维链)。
这次发布也带来了一项榜单结果。
在最近更新的 TriWorldBench 榜单中,共收录了 36 个模型,CWM 以 66.04 分排名第一,第二名 dream4act 为 65.66 分。
从分项看,CausalWM 在跨视角、任务和运动相关指标上表现靠前,同时又在世界合理性和视觉质量上斩获第一——
在三视角一致性维度排名第 2,任务对齐维度排第 3,运动质量维度排第 2,视觉质量维度排第 2,透视合理性和图像质量则拿到了单项第一。
因此,这次第一名可以证明 CausalWM 其背后采用的因果路线展现出了对物理世界更强的建模能力。
它也释放了一个产业信号:世界模型的一部分评测重心,正从 " 谁的视频更像 ",转向 " 谁能生成一个可供行动的统一世界 "。
2.CausalWM:把中间物理过程写进预测链
传统世界模型已经能做动作条件预测:给定当前状态和控制信号,生成未来画面。CausalWM 想进一步处理的是另一个问题——模型究竟依靠什么中间物理变量完成预测。
Aether AI 选择把这部分过程显式展开。团队将光流、深度、几何等可自动提取的物理变量组织成一条有顺序的推理链:
Observation → Motion → Geometry → Future
这里的关键不是多预测几个额外特征,而是让前一步结果真正成为下一步的条件。先描述运动,再补充空间结构,最终共同参与未来视频的生成。训练中,后续变量不会提前泄露给前序阶段;推理时,模型也按照同样的顺序逐级生成。因此,CausalWM 试图把原本压缩在隐变量里的物理过程,变成一条可以显式监督和复用的因果思维链(Causal CoT)。
在接收到一个观察结果和语言指令后,因果工作记忆系统会通过明确的运动和几何预测来生成未来的情景 图源:Aether AI 官网
为了训练 CausalWM,Aether AI 构建了一个约 30K 小时的视频数据集,覆盖机器人操作、第一视角视频和多视角交互场景。
训练分成三个阶段:
第一阶段先解决生成能力。CausalWM 基于 LTX-2.3-22B 继续训练,学习语言条件、动作条件和多视角未来预测。
第二阶段加入 Causal CoT。光流、深度和点云信息被作为中间物理变量,按照固定顺序参与预测。前一阶段生成的特征会重新进入上下文,后续预测再以此为条件。由于这些监督信号可以从原始视频自动提取,这套 CoT 训练可以扩展到大规模视频数据,而不依赖人工逐帧标注。
第三阶段再用多目标强化学习优化完整生成结果。视频预测本身具有开放性,同一个状态可能对应多个合理未来,单纯监督学习并不能直接保证物理一致性、视觉质量和任务完成度。CausalWM 因此对同一上下文采样多个未来,并根据多类奖励进行组内优化。这样一来,中间 CoT 也不再只是模仿固定模式,而可以根据最终视频质量被进一步调整。
CausalWM 训练的三个阶段:一种共享扩散式转换器先预测光流,然后生成点图,最后预测未来的 RGB 图像。每个完成的流段都会保持不变,作为下一个流段的背景信息;因果注意力机制会屏蔽后续阶段的信息。 图源:Aether AI 官网
CausalWM 还有一个比较有意思的结果:训练 CoT 之后,模型不仅会预测这些中间变量,也更擅长利用新的上下文信息控制。这给模型留下了一个相对通用的控制接口:只要某种控制信号可以被表示成视觉形式,就可以沿着现有 上下文窗口注入模型,实现上下文学习(In-context Learning)。
例如,在机器人场景中,可以把 simulator 给出的机器臂轨迹渲染成运动视频,经过少量微调后,模型就可以根据这些轨迹生成相匹配的未来视频。这意味着,中间变量不再只是 " 解释模型预测 " 的辅助信息,也可以反过来成为因果干涉(Causal Intervention)的窗口。类似机制还可以扩展到物体轨迹、目标姿态等信号。
3. 因果路线真正想省下的是 " 重训税 "
机器人完成一次演示,离规模化部署还很远。
机械臂换了夹爪,工厂换上一批反光零件,家庭环境里多了一张粗糙桌面,模型都可能需要重新采集数据、增加遥操作示范,再做一轮微调。部署方关心演示视频里的成功率,也会追问模型遇到变化后的恢复成本:需要补多少数据?跑多少次真机?投入多少工程人 / 天 ?
这些重复投入,我们认为可以叫作 " 重训税 "。如果因果方法能够让部分机制在新场景中复用,它的商业价值就体现在降低这笔成本上。
如果模型学到的机制能够拆开复用,局部变化就有机会局部调整。桌面摩擦变了,更新接触和滑动相关的部分;夹爪尺寸变了,重新校准本体接口;抓取和放置已经学会,面对新的物体组合时沿用已有经验。只有这套设想能够落地,机器人的边际交付成本才可能下降。
ICLR 2025 的 WM3C 研究沿着相近方向,把语言中的动作和物体拆成可组合的动力学组件,测试模型对未见任务的适配。实验支持因果模块化改善迁移的可能性,不过任务数量有限,验证环境也以仿真为主。
(a)环境模型示意图(b)环境模型的因果图示 图源:《Modeling Unseen Environments with Language-guided Composable Causal Components in Reinforcement Learning》
Aether AI 此前提出的 CD-LAM 则从动作表征入手。论文发现,隐式动作模型容易把背景、场景和镜头变化一并塞进 " 动作 " 表示——下游世界模型名义上接收了动作条件,预测时仍可能依赖画面连续性,甚至在收到静止指令后继续让机械臂移动。
CD-LAM 通过提高机械臂和被操作物体的学习权重,拉近同类动作的表征,然后再把相同画面之间的变化校准为接近零动作。论文在 2B 和 14B 两种模型上报告,接入真实机器人动作后,动作跟随误差相对基线下降约 30%,适配所需更新次数减少 12 倍以上。这项工作说明:控制信号可以通过表示去偏重新接回模型。
CD-LAM 在 DreamDojo 上显著提升了动作跟随、视觉保真度和数据效率。图源:Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
理论给出了因果模型可能更稳健的条件,经验研究的结果则取决于具体任务和数据。
ICLR 2024 的 Robust agents learn causal world models 在特定理论设定中推导出:智能体若要应对足够广泛的分布变化,需要学到近似的数据生成因果模型;
放到世界模型行业,各家选择的入口并不相同:Meta 的 V-JEPA 2 主要在潜空间学习预测和规划;英伟达 Cosmos 提供物理 AI 所需的生成模型和数据工具;Google DeepMind 的 Genie 3 侧重实时可交互环境;World Labs 的 Atlas 处理文本、图像、视频和 3D 共享的空间上下文。Aether AI 选择把运动、几何等中间表征显式化,再尝试让这些表征承担控制条件。
这些路线可以组合——生成模型负责扩充训练环境,潜空间模型提高表征和规划效率,因果模块尝试处理变化中的机制复用。此外,系统效果还取决于一系列模型之外的条件:仿真环境能否重置、干预变量是否可控、验证器是否可靠,以及失败经验能否复用。
目前我们能看到的是,CWM 给出了一种结构设计,TriWorldBench 记录了视频生成侧的成绩。但是两者之间还缺一条证据链:显式的运动和几何中间过程,能否让模型换环境后少补数据、少跑真机、更快恢复?
判断 " 重训税 " 是否真的下降,需要把视线移到更严格的干预评测和真机闭环。
4. 从 Causal CoT 到因果智能,还缺哪些证据?
按照 Aether AI 的长期设想,因果世界模型还要回答:哪些变量真正决定未来,改变某个变量会带来什么结果。第一版 CWM 模型给出的 Causal CoT 的起点已经很具体,但这还不足以说明模型已经找到了真实的因果变量。
第一类证据来自更严格的干预与组合评测。主动改变物体质量、摩擦、光照、相机位置或动作策略,可以观察模型能否分清外观变化与动力学变化。把见过的动作、物体和环境重新组合,再记录模型需要补多少数据、经过多少次更新才能恢复性能。这条恢复曲线比单次 " 零样本成功 " 更接近部署实际。
第二类证据来自真机闭环。世界模型进入真实机器人后,策略要根据预测选择动作,连续处理误差累积,并在失败时找到需要调整的环节。不同路线还应尽量使用相近的数据量、模型规模、交互次数和推理成本。模型版本、训练设置、随机方差与失败案例也需要公开,第三方才能分辨提升来自结构设计还是资源投入。
Aether AI 表示,后续还会继续围绕因果世界模型,探索更优的因果表征学习和因果推理策略,让模型能够更好地识别物理世界中的关键因果变量、理解变量之间的因果依赖,为下一代因果智能(Causal Intelligence)建立基础。从物理世界出发,Aether AI 希望进一步打通因果世界理解与行动生成,让模型从预测世界,走向理解因果、利用因果并作用于世界,最终实现:让 AI 理解什么真正影响结果,以及不同的行动与干预将如何改变未来。


登录后才可以发布评论哦
打开小程序可以发布评论哦