量子位 昨天
H-JEPA!LeCun世界模型创业交卷,代码权重全部开源
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

LeCun 的世界模型初创公司 AMI(Advanced Machine Intelligence),刚刚低调交卷了。

在最新的论文H-JEPA中,AMI 联合纽约大学、巴黎 INRIA 和布朗大学的研究者,推出了面向视觉规划的分层世界模型。

H-JEPA 将多个 JEPA 逐层堆叠起来,让各层在自己的表征空间中,预测不同时间跨度后的状态。

规划时,高层先制定粗略计划,再把预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可以执行的动作。

通过这种分工,世界模型既能规划长远目标,也能处理眼前动作。

在 Visual AntMaze 仿真迷宫任务中,三层 H-JEPA 的成功率达到73%,单层模型为18%。

同时,在多项仿真任务中,分层模型还以更少的规划计算量取得了更好的表现。

除了交出肉眼可见的测试成绩以外,H-JEPA 还延续了 LeCun 在创业之初就强调的开源路线。

团队同步公开了代码和预训练模型权重,研究者可以直接加载模型,复现规划实验。

为什么世界模型需要分层规划?

这件事,LeCun 其实念叨很久了。

早在 2022 年,还在 Meta 担任首席 AI 科学家时,他就提出过分层 JEPA 的构想:

让模型在不同抽象层级和时间尺度上预测,再通过分层规划,把复杂目标落实为动作。

这乍一听可能有点抽象,但如果用 LeCun 经常举的例子来看,其实很容易理解。

假设你正坐在纽约大学的办公室里,准备去巴黎。规划整趟行程时,你关注的是目的地、航班和时间安排。

确定行程后,你开始进一步安排如何离开办公室、下楼、打车去机场。

等到了真正走出办公室时,你关注的信息又变成了眼前的地面、楼梯,以及下一步该落在哪里,先迈哪只脚。

△AI 生成

这些规划层级既覆盖不同的时间跨度,也需要不同的信息。规划航程时,脚下某一级台阶的高度并不重要;走下楼梯时,这个细节却直接决定你该怎样迈步。

而这,也并不是人类规划独有的特性。对于机器人来说,高层需要理解任务目标、环境关系和未来方向,低层则需要掌握具体动作和身体控制细节。

比如,四足机器人已经走到了目标位置,但腿部姿态与目标画面不同,模型仍可能因为这些差异,认为自己离目标很远。

于是到这里,问题就变成了:

如何让不同层级分别学习适合自己的信息表征,再把高层计划逐步落实为低层动作?

H-JEPA 具体怎么做?

具体来说,为了解决上面的问题,H-JEPA 在每一层配置了三个组件,分别处理状态、动作和预测。

其中,状态编码器,负责提取当前环境的表征。最低层直接读取图像,更高层则基于下层表征进一步抽象,保留这一时间尺度下更重要的信息。

动作编码器,负责描述动作带来的变化。低层表示具体动作,高层则将一段连续动作压缩成更粗粒度的变化。

预测器,则结合当前状态和动作,预测未来状态。不同层级覆盖不同时间跨度,论文实验中,相邻高层的一步对应低层的两步预测。

在模型训练方面,上面各层通过端到端训练共同学习,不同层级通过子目标衔接。

高层预测出的中间状态成为低层的子目标,低层会把自己预测的状态转换到高层表征空间,与高层指定的子目标比较,再据此调整动作。

不过,在训练世界模型时,还需要解决一个经典问题:表征坍塌。

如果编码器把所有输入都压缩成同一个向量,预测器只输出这个向量,也能获得很低的预测误差,但模型实际上没有学到任何有用的信息。

为此,H-JEPA 沿用了 LeCun 团队此前在 LeJEPA 中提出的SIGReg,对表征分布进行约束,避免不同状态被压缩到同一个向量。

今年的 LeWorldModel 把这套方法用于世界模型训练。H-JEPA 则以它为最底层,向上增加更多 JEPA,形成共同训练、由上至下规划的结构。

在实验中,研究者进一步观察到了不同层级的信息取舍。迷宫任务里,高层逐渐弱化腿部姿态,但仍保留了机器人的位置信息。

不过,分层也有适用条件。Push-T 任务中的两层模型表现较好,增加到三层、四层后,成绩反而下降。

论文认为,这可能是较短的任务轨迹可能限制了高层可用的训练数据。

LeCun,还是那个 LeCun

总的来说,H-JEPA 的这些设计,延续了 JEPA 的一项基本主张:在表征空间中完成预测。

JEPA 的全称是 " 联合嵌入预测架构 "。LLM 通常通过预测下一个 token 来学习生成内容;视觉 JEPA 则先把图像、视频编码成内部表征,再预测目标部分的表征,无需逐个生成图像像素。

在 H-JEPA 这类世界模型中,模型还会结合动作,预测未来状态的表征。规划器据此比较不同动作的后果,寻找通向目标的方案。

LeCun 一直认为,理解世界、预测行动后果和规划,是走向人类级智能必须具备的能力。他对 LLM 的判断,也始终围绕这一点。

今年 9 月,在瑞典马尔默举行的 ECCV 上,他的演讲幻灯片再次出现了那句熟悉的建议:

如果你对人类级 AI 感兴趣,就不要研究 LLM。

这张幻灯片传到社交平台后,有人怀疑是不是假的。LeCun 回复:

包是真的。

他随后补充,基于 LLM 的 AI 工具非常有用,大家都在使用。但他认为,单靠 LLM 本身无法走到人类级智能。

如今,这套研究主张也成为 AMI 的创业方向。

今年 3 月,AMI 宣布完成10.3 亿美元融资,投前估值 35 亿美元。

公司由 LeCun 担任董事长,Alexandre LeBrun 担任 CEO,谢赛宁担任首席科学家,Pascale Fung 负责研究与创新,Michael Rabbat 负责世界模型,而 Rabbat 也是这次 H-JEPA 论文的作者之一。

不过,有一说一,研究成果归研究成果,外界对 AMI 的另一个期待,仍然是产品。

至少从目前官网来看,公司展示的主要还是技术方向、团队和招聘信息,尚未看到面向公众的产品入口。

另一边,同样押注世界模型的 World Labs,已经迎来了新的转折。

9 月 28 日,AMD 宣布与李飞飞创办的 World Labs 签订约82 亿美元的全股票收购协议。

可以说,一边正在走向与芯片公司的结合,另一边则继续沿着自己的研究路线往前推进。

但随着李飞飞的世界模型创业有了里程碑进展,Yann LeCun 的大结果是不是也只是时间问题而已…了呢?

参考链接

[ 1 ] https://venturebeat.com/technology/h-jepa-teaches-world-models-to-plan-at-multiple-levels-of-abstraction

[ 2 ] https://arxiv.org/pdf/2610.06805

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

点亮星标

科技前沿进展每日见

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

巴黎 纽约大学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论