LeCun 的世界模型初创公司 AMI(Advanced Machine Intelligence),刚刚低调交卷了。
在最新的论文H-JEPA中,AMI 联合纽约大学、巴黎 INRIA 和布朗大学的研究者,推出了面向视觉规划的分层世界模型。
H-JEPA 将多个 JEPA 逐层堆叠起来,让各层在自己的表征空间中,预测不同时间跨度后的状态。
规划时,高层先制定粗略计划,再把预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可以执行的动作。
通过这种分工,世界模型既能规划长远目标,也能处理眼前动作。
在 Visual AntMaze 仿真迷宫任务中,三层 H-JEPA 的成功率达到73%,单层模型为18%。
同时,在多项仿真任务中,分层模型还以更少的规划计算量取得了更好的表现。
除了交出肉眼可见的测试成绩以外,H-JEPA 还延续了 LeCun 在创业之初就强调的开源路线。
团队同步公开了代码和预训练模型权重,研究者可以直接加载模型,复现规划实验。
为什么世界模型需要分层规划?
这件事,LeCun 其实念叨很久了。
早在 2022 年,还在 Meta 担任首席 AI 科学家时,他就提出过分层 JEPA 的构想:
让模型在不同抽象层级和时间尺度上预测,再通过分层规划,把复杂目标落实为动作。
这乍一听可能有点抽象,但如果用 LeCun 经常举的例子来看,其实很容易理解。
假设你正坐在纽约大学的办公室里,准备去巴黎。规划整趟行程时,你关注的是目的地、航班和时间安排。
确定行程后,你开始进一步安排如何离开办公室、下楼、打车去机场。
等到了真正走出办公室时,你关注的信息又变成了眼前的地面、楼梯,以及下一步该落在哪里,先迈哪只脚。
△AI 生成
这些规划层级既覆盖不同的时间跨度,也需要不同的信息。规划航程时,脚下某一级台阶的高度并不重要;走下楼梯时,这个细节却直接决定你该怎样迈步。
而这,也并不是人类规划独有的特性。对于机器人来说,高层需要理解任务目标、环境关系和未来方向,低层则需要掌握具体动作和身体控制细节。
比如,四足机器人已经走到了目标位置,但腿部姿态与目标画面不同,模型仍可能因为这些差异,认为自己离目标很远。
于是到这里,问题就变成了:
如何让不同层级分别学习适合自己的信息表征,再把高层计划逐步落实为低层动作?
H-JEPA 具体怎么做?
具体来说,为了解决上面的问题,H-JEPA 在每一层配置了三个组件,分别处理状态、动作和预测。
其中,状态编码器,负责提取当前环境的表征。最低层直接读取图像,更高层则基于下层表征进一步抽象,保留这一时间尺度下更重要的信息。
动作编码器,负责描述动作带来的变化。低层表示具体动作,高层则将一段连续动作压缩成更粗粒度的变化。
预测器,则结合当前状态和动作,预测未来状态。不同层级覆盖不同时间跨度,论文实验中,相邻高层的一步对应低层的两步预测。
在模型训练方面,上面各层通过端到端训练共同学习,不同层级通过子目标衔接。
高层预测出的中间状态成为低层的子目标,低层会把自己预测的状态转换到高层表征空间,与高层指定的子目标比较,再据此调整动作。
不过,在训练世界模型时,还需要解决一个经典问题:表征坍塌。
如果编码器把所有输入都压缩成同一个向量,预测器只输出这个向量,也能获得很低的预测误差,但模型实际上没有学到任何有用的信息。
为此,H-JEPA 沿用了 LeCun 团队此前在 LeJEPA 中提出的SIGReg,对表征分布进行约束,避免不同状态被压缩到同一个向量。
今年的 LeWorldModel 把这套方法用于世界模型训练。H-JEPA 则以它为最底层,向上增加更多 JEPA,形成共同训练、由上至下规划的结构。
在实验中,研究者进一步观察到了不同层级的信息取舍。迷宫任务里,高层逐渐弱化腿部姿态,但仍保留了机器人的位置信息。
不过,分层也有适用条件。Push-T 任务中的两层模型表现较好,增加到三层、四层后,成绩反而下降。
论文认为,这可能是较短的任务轨迹可能限制了高层可用的训练数据。
LeCun,还是那个 LeCun
总的来说,H-JEPA 的这些设计,延续了 JEPA 的一项基本主张:在表征空间中完成预测。
JEPA 的全称是 " 联合嵌入预测架构 "。LLM 通常通过预测下一个 token 来学习生成内容;视觉 JEPA 则先把图像、视频编码成内部表征,再预测目标部分的表征,无需逐个生成图像像素。
在 H-JEPA 这类世界模型中,模型还会结合动作,预测未来状态的表征。规划器据此比较不同动作的后果,寻找通向目标的方案。
LeCun 一直认为,理解世界、预测行动后果和规划,是走向人类级智能必须具备的能力。他对 LLM 的判断,也始终围绕这一点。
今年 9 月,在瑞典马尔默举行的 ECCV 上,他的演讲幻灯片再次出现了那句熟悉的建议:
如果你对人类级 AI 感兴趣,就不要研究 LLM。
这张幻灯片传到社交平台后,有人怀疑是不是假的。LeCun 回复:
包是真的。
他随后补充,基于 LLM 的 AI 工具非常有用,大家都在使用。但他认为,单靠 LLM 本身无法走到人类级智能。
如今,这套研究主张也成为 AMI 的创业方向。
今年 3 月,AMI 宣布完成10.3 亿美元融资,投前估值 35 亿美元。
公司由 LeCun 担任董事长,Alexandre LeBrun 担任 CEO,谢赛宁担任首席科学家,Pascale Fung 负责研究与创新,Michael Rabbat 负责世界模型,而 Rabbat 也是这次 H-JEPA 论文的作者之一。
不过,有一说一,研究成果归研究成果,外界对 AMI 的另一个期待,仍然是产品。
至少从目前官网来看,公司展示的主要还是技术方向、团队和招聘信息,尚未看到面向公众的产品入口。
另一边,同样押注世界模型的 World Labs,已经迎来了新的转折。
9 月 28 日,AMD 宣布与李飞飞创办的 World Labs 签订约82 亿美元的全股票收购协议。
可以说,一边正在走向与芯片公司的结合,另一边则继续沿着自己的研究路线往前推进。
但随着李飞飞的世界模型创业有了里程碑进展,Yann LeCun 的大结果是不是也只是时间问题而已…了呢?
参考链接
[ 1 ] https://venturebeat.com/technology/h-jepa-teaches-world-models-to-plan-at-multiple-levels-of-abstraction
[ 2 ] https://arxiv.org/pdf/2610.06805
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦