世界模型是物理原生智能(Physics-native Intelligence,Phi)重要的组成环节。
面对图像、视频和传感器数据等多模态高维观测,世界模型通常先将其编码为紧凑的低维隐状态,再在隐空间中学习状态随时间和动作变化的规律,从而预测未来并辅助决策。
然而,较低的预测误差是否意味着模型真正捕捉到了物理世界的运行规律?它学到的隐状态是否对应真实状态,又能否准确反映动作对未来状态的影响?
2026 年 5 月份,图灵奖得主杨立昆(Yann LeCun)提出的联合嵌入预测架构(JEPA)从理论上证明:满足特定条件时,世界模型是能够从高维观测中恢复真实的状态表征的。不过,这一理论主要关注自治世界模型的表征恢复,尚未拓展至一般受控系统,因此尚无法回答模型能否进一步辨识动作对状态转移的影响。
近期,清华大学李升波教授课题组(iDLab)与滴滴深穹远航实验室(Voyager Lab)组成的联合研究团队,将 JEPA 的训练架构与受控世界模型(Controlled World Model,CWM)进行了结合,对世界模型表征及转移的可辨识性问题给出了他们的认知与理解。
与自治世界模型不同,受控世界模型同时接收当前的隐状态和当前的动作,并在隐空间中预测下一状态,进而输出该状态对应的观测。研究表明:满足一定约束条件下,由 JEPA 架构训练的受控世界模型能够在 " 正交变换 " 意义下,同时恢复真实的状态表征和动作支配的转移规律。

进一步地,该研究发展了受控世界模型的可辨识性理论,提出了" 表征裕度 "和" 转移裕度 "两个关键指标,分别刻画状态表征与受控转移实现可靠辨识所需的条件。其中,表征裕度衡量了环境中的可预测信息是否足以支撑真实状态的恢复,转移裕度衡量了训练数据在同一状态下是否包含足够的动作变化。
论文的主要结果是,受控世界模型的可辨识性依赖于两个条件,即表征裕度和转移裕度同时为正值,同时满足:

表征裕度不足将会影响真实状态的恢复能力,而转移裕度不足则可能导致模型难以预测较少出现的动作。
受控世界模型与可识别性理论
参考杨立昆(Yann LeCun)及其合作者的思路,这一研究仍考虑平稳线性—高斯系统作为真实世界的转移模型。潜在状态服从标准高斯分布,观测由未知可逆非线性映射 g 生成;下一状态由当前状态、动作和独立高斯噪声共同决定:

训练轨迹来自行为策略,动作允许依赖当前状态,因而可以覆盖从充分随机探索到确定性闭环策略的不同数据分布。学习器由编码器 h 和动作条件预测器 F 构成,在行为分布诱导的总体平方损失下训练。编码器输出被约束为标准高斯分布,以防止塌缩并固定尺度;预测器类假设足够丰富且连续,可以表达给定表征和动作后的最优条件均值。
论文用两个策略相关的裕度分别刻画表征与转移的可识别性。
表征可识别性:关注编码器能否从未知的非线性观测中恢复真实潜在状态,由表征裕度

刻画,衡量最弱的一阶潜在预测信号与最强高阶非线性替代信号之间的谱间隔:

转移可识别性:关注模型能否在同一组恢复坐标中,辨认状态自身演化与动作引起的变化,并正确预测候选动作对应的未来状态,由转移裕度刻画,衡量给定当前状态后仍然存在的最弱动作变化方向的强度:

当

时,每个真实潜在方向都比任何高阶非线性替代更可预测,因而线性项占据主导,可以从中恢复出真实表征。当时,每个动作方向在给定状态后都具有非退化变化,模型可以把状态效应与动作效应分离。

△受控世界模型的可辨识性:表征辨识性与转移辨识性理论分析与证明
对于受控世界模型的可辨识性,论文证明了 JEPA 架构下的联合预测能够同时正确恢复表征和转移两类信息,同时分析了学习的误差界,以及有限动作覆盖对行为分布之外的预测误差的放大作用。
定理 1:状态与受控转移的联合可识别性
当状态与动作满足联合高斯行为分布、平稳线性受控转移、预测器充分丰富且连续、观测映射可逆和标准高斯表征约束时。若

,,则存在正交矩阵 Q,使得状态空间和表征能够同时在正交变换意义下完全辨识:

证明的核心是把编码器在高斯空间中展开为 Hermite 分量。真实潜在变量对应一阶分量,而高阶分量的可预测能量至多由

控制。正的谱间隔迫使全局最优表征只保留一阶分量;标准高斯约束进一步把线性映射限制为正交矩阵。代回受控动力学后,正的条件动作协方差和预测器连续性把行为分布上的等式扩展到完整状态—动作空间。
定理 2:行为策略下的定量可识别性
设为编码器相对最优表征的误差,为学习预测器相对该表征下最优条件均值预测器的误差,定义;若存在常数 c 使得,则存在正交矩阵 Q 和常数 C,使得:

该定理将训练误差拆成两个来源:衡量编码器是否正确恢复隐状态空间,则衡量预测头是否在该坐标下充分逼近条件均值。表征谱间隔越小,高阶非线性特征越接近真实潜在方向的可预测性,相同训练误差可能对应更大的表征偏差。
定理 3:反事实预测误差的可达放大
假设潜在表征已经恢复为 y=Qz,真实的受控条件均值预测器为

。对于任意预测器 F,分别定义其在行为策略下相对于 F* 的过剩风险,以及在反事实动作分布下的预测误差:

其中,反事实动作与行为策略具有相同的条件均值,但具有更充分的条件动作变化。在定理 1 的条件及相应的预测器类别假设下,对于任意,均可以构造一个连续预测器,使其满足:

该定理表明,即使预测器在行为策略分布下的误差仅为,其在反事实动作分布下的误差仍可能被放大至。因此,反事实预测的潜在误差放大与转移可辨识性裕度成反比。需要强调的是,这一结果给出了可由特定预测器达到的误差放大,而不是对所有预测器均成立的统一上界。
实验验证非线性观测的表征可识别性
第一组实验固定条件动作激励

,并通过改变可预测信号谱来扫描表征裕度

。论文研究了在 spiral、parabolic、sinusoidal 和 wave 四种非线性观测映射上重复实验。

△四种非线性观测及其学习表征。颜色与极坐标校准线用于追踪对应的潜在位置;恢复结果允许保留正交旋转。

△随表征裕度增大,表征误差和受控转移误差整体下降;虚线标出理论充分条件表征裕度 =0 的边界。
当表征裕度增加时,编码器更稳定地逆转非线性观测,并在正交变换意义下恢复隐状态;受控转移误差也同步下降。
行为策略覆盖与反事实可靠性
第二组实验保持表征处于可识别区域,仅改变探索尺度,从而单独考察条件动作覆盖。即使在 =0 时,模型对行为动作的预测误差仍可很小;但反事实误差、状态矩阵 A 的估计误差和动作矩阵 B 的估计误差都明显增大。

△条件动作覆盖从确定性策略逐步增强时,行为误差、反事实误差放大以及 A、B 两部分的估计误差变化。
随着增大,行为策略在同一状态附近提供更多动作变化,模型逐步分离自主状态演化与动作效应,反事实误差相应下降。由于该过程中表征误差始终较低且保持为正,改进可归因于转移激励,而不是编码器质量的变化。
从转移识别到目标条件规划
规划器需要比较可能偏离行为策略的动作序列,因此弱激励方向上的误差会直接影响候选动作排序。论文使用同一组有界动作序列进行目标条件规划:模型在潜在空间中预测各序列终点,选择最接近目标的序列,再在真实条件均值动力学中执行。

△不同条件动作覆盖下的预测可达终点与真实可达终点。覆盖增强后,两者逐步对齐,模型所选序列的执行偏差明显减小。
这些实验表明,当条件动作覆盖不足时,即使模型在训练数据上的预测误差较小,对覆盖较弱的动作方向仍可能预测不准,导致预测可达终点与真实可达终点存在偏差。
规划器基于模型预测选择最接近目标的动作序列,但该序列在真实动力学中执行后可能无法到达预期位置。随着条件动作覆盖增强,预测可达集逐渐与真实可达集对齐,模型预测结果与实际执行结果之间的偏差也相应减小。
总结
综上所述,这一研究把预测式表征学习与受控系统辨识联系起来,在同一学习目标下区分了 " 状态坐标是否恢复 " 和 " 动作响应是否识别 " 两个问题。表征裕度描述预测信号能否排除非线性替代表征,转移裕度描述行为数据能否分离状态演化与动作效应。
由此可以解释,为什么动作条件建模、较低训练误差和可靠反事实规划之间并不自动等价。对模型设计与评估而言,该研究提示后续的研究者不能只检查行为分布上的一步预测误差,还应关注给定状态后的动作覆盖、行为分布外的动作响应,以及状态项与动作项能否被分别恢复。对离线数据采集而言,适量探索噪声不仅扩大动作支持,还直接改善近似转移识别的条件性。
参考文献:
[ 1 ] Zhang, XT.; Guan, Y.; Zhang, B.; Li, HY.; Zhang Y-Q; and Li, S. E. ( 2026 ) On the Identifiability of Controlled World Models. arXiv:2607.22430
[ 2 ] Li, S. E. ( 2023 ) Reinforcement Learning for Sequential Decision and Optimal Control. Springer.
[ 3 ] Klindt, D.; LeCun, Y.; and Balestriero, R. ( 2026 ) When Does LeJEPA Learn a World Model? arXiv:2605.26379.
[ 4 ] Maes, L.; Lidec, Q. L.; Scieur, D.; LeCun, Y.; and Balestriero, R. ( 2026 ) LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels. arXiv:2603.19312.
[ 5 ] Zhan, G.; Wang, L.; Zhang, X.; Gao, J.; Tomizuka, M.; and Li, S. E. 2025. Bootstrap Off-policy with World Model. NeurIPS, volume 38, 134093-134121.
论文链接:https://arxiv.org/abs/2607.22430
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦