"要能够从数据当中抓到可以预测的结构形成记忆的部分。"
作者:苏打
编辑:tuya
出品:财经涂鸦(ID:caijingtuya)

公司情报专家《财经涂鸦》获悉,9 月 10 日下午 2026 Inclusion · 外滩大会上,由香港大学计算与数据科学学院主办、香港大学上海智能计算研究院协办的 " 世界模型是 AI 走向物理世界的新大陆吗 " 见解论坛正式举行。
现场圆桌环节,嘉宾围绕世界模型的定义、研究动因、潜在风险、适用场景及大模型发展带来的影响,交流了各自判断。
忆生科技联合创始人兼 CTO、香港大学计算与数据科学学院助理教授杨言超认为,一套系统要具备理解和预测未来、从数据中提取可预测的结构并形成记忆,以及依赖记忆持续学习和进化三个关键条件,才真正算是具身智能的世界模型。
以下为杨言超现场观点精编:
Q:世界模型与视频生成、物理仿真器、VLA 或纯策略模型的本质区别是什么?一套系统至少要具备什么能力,才真正算是具身智能的 " 世界模型 "?
杨言超:我给一个我认为准确的定义。首先,肯定是要能够理解和预测未来,包括预测视频和预测动作;第二个条件是它需要能够从数据当中抓到可以预测的结构形成记忆的这部分;第三个是能够依赖形成的记忆能够持续不断地自我进化。
用这个定义来看视频生成模型,包括 VLA,它们对于预测都是有的,但是在怎么抓取结构形成记忆,以及依赖这个记忆去得到一个可以不断持续进化的机制方面还是比较薄弱的。
Q:是什么现实问题、研究经历或产品现场让你开始认真相信,AI 需要理解世界,而不只是生成内容?
杨言超:举个例子,我们现在的模型能生成非常高清的图片和视频,这个能力是一定超过了一个 3 岁小孩子的能力的。
比如说大家现在如果闭上眼睛 5 秒钟想象一下讲台,左前方或者右前方的像素是什么样子的,我们做不到,我们 AI 可以做到很好,生成非常逼真的图片,但是从另外一个角度而言,当一个 3 岁的小孩他在面临一个新的玩具的时候,不会玩这个玩具的时候,我们大人是怎么教他的,我们在旁边演示一下,小孩子看看,再多尝试几遍就会了。
这个过程是现在的 AI 模型不具备的,所以这样的事例就让我开始真正地思考,我们的模型如果只是专注于生成,并不一定等于他真正的理解。
这种真正的理解的能力才是我们的模型真正能够进入 C 端用户场景的一个必要能力,因为用户的场景是无形在变化的,新的任务也会不断地涌现,怎么能够让机器人去适应理解的能力是非常重要的。
Q:世界模型当前最被全行业高估的一点是什么?如果这条路线最终没能成为物理 AI 的主流,它最可能输在哪里?
杨言超:这是一个很难的问题,我觉得可能最高估的就是会把它生成的准确可能当成了理解。现在训练模型,监督信号是像素之间的人物差异要很小。但是不是把所有像素都生成完美的时候就理解了,把事情做对了呢?我觉得不是的。
在我们的研究和试验的过程当中我们发现,模型生成的视频的方面和指导机器人交互的正确率是没有关联的,反而数据里面的结构和模型指导物理交互的能力是成正比的。
所以大家可能会想我们不断地去收集数据,扩大模型的参数,把像素级别的生成做到完美,是不是就最终让我们实现甚至是通用智能,我觉得这个地方可能打一个引号。这就是我认为可能会被高估的一个地方。
Q:在一个具体落地的场景或者是任务里面有没有哪些落地的场景跟任务是必须应该使用世界模型的?
杨言超:我觉得世界模型它的一个优点是可以在没有实际采取动作的时候去对未来做预测。
但什么时候需要用到世界模型呢?我想可能得从两个维度考虑一下。
一个就是试错的代价有多高,另外一个就是这个任务训练数据后续的成本有多大。
如果一个任务的试错代价极高,任务的获取成本也非常高,我觉得这个时候是世界模型可以大展拳脚的时候,如果一个任务试错成本代价不是很大,也容易获得,比如说抓取的操作任务,可能就是不去每一帧都去解决,或许这是最优选项。
所以关键不是每次做一次决策跑一次世界模型,而在于什么时候我们能够把这个世界模型最大化,其中主要就是试错的代价和成本上。
Q:最近 GPT 出现一个很强的泛化能力,对物理的 AI 有没有什么冲击,比如说对世界模型和技术路线有没有冲击,如果有的话是什么?如果没有的话会是什么?
杨言超:GPT6 能做到世界模型很重要的功能。其实人的工作的方式有点类似,刚刚我提到世界模型要具备预测理解的能力,以及同时具备形成记忆,基于记忆去进化,去持续学习新任务的能力。所以 GPT6 的出现更多是看到一种希望,当我们把世界模型能够很好地调用它,在它能够完成的任务上很好地去使用它,并且能够形成记忆,同时通过这个记忆不断强化世界模型,那时候我们应该离它就很接近了。
Q:作为一个具身企业,你们希望自己的产品最想完成一件什么样的事情?这个事情会付出多少成本?
杨言超:忆生科技的使命是构建一个基于记忆持续的进化学习的物理 Agent 系统,所以我们就是能力即产品,也在这方面目前也做了很多的试验和一些进展。
我们给大家一个评测,能够进入用户场景的机器人,要看它能不能看一遍就会,并且断电后第二天还会,而且是持续的进化。如果我们能够把这样的机器人构建出来,就可以打入 C 端场景。这是我们愿意花全部的精力来实现的目标。
最近我们也研究了一个评测,演示一遍之后,机器人面对不同的场景、不同物体、不同环境能够做到多好。欢迎大家来使用和评测。
Q:为什么目前具身机器人还只能做一些简单的工作?
杨言超:我觉得有两个点,一个是数据,比如说打领带什么的。所以我们采数据也会存在一些问题,毕竟一些反馈还没有做到非常好。
另外一点是我们的学习系统在记忆这块做得还不够好,大家现在看到很多单点任务训练出来非常好的玩魔方类似的 Demo,但是都没有形成一个记忆。照理说它应该能够很顺畅地拧一个瓶盖,但因为现在的系统在记忆这块很薄弱,所以没办法基于记忆持续进化。
本文由公众号财经涂鸦(ID:caijingtuya)原创撰写,如需转载请联系涂鸦君。
添加涂鸦君个人微信(ID:tuyaclub)
加入【公司情报社群】
参与资本市场讨论
获取一手情报


登录后才可以发布评论哦
打开小程序可以发布评论哦