中国经济网 1小时前
世界模型是AI走向物理世界的新大陆吗?——2026外滩大会见解论坛侧记
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

从自动驾驶到通用人形机器人,AI 能否真正具备理解物理规律、空间推理与动态交互的核心能力?" 世界模型 " 不再只是生成式 AI 的技术延伸,更是具身智能打破虚拟与现实壁垒的核心基础设施。但它能否真正理解环境、可靠执行复杂任务、以可承受成本规模化落地,仍是当下行业待解的核心命题。

9 月 10 日下午,在香港大学计算与数据科学学院主办、香港大学上海智能计算研究院协办的一场 2026 Inclusion · 外滩大会见解论坛上,来自高校与企业的嘉宾围绕世界模型的能力边界、技术路径及商业化挑战展开交流与探讨。

香港大学计算与数据科学学院创始院长马毅在开幕演讲中表示,三维与四维世界感知和建模是计算机视觉领域的核心研究问题。如今的世界模型已超出传统三维重建、物体识别的范畴,指向机器人在开放物理环境中感知、认知、学习与价值创造全过程。

图为香港大学计算与数据科学学院创始院长马毅作开幕演讲。中国经济网记者 李月华 摄

生数科技联合创始人兼 CEO 骆怡航发表题为《在行动前,看见未来:从世界模型第一性原理出发》的主题演讲。他提出,界定世界模型核心能力的关键,在于能否形成 " 理解—想象—行动 " 的完整闭环。基于这一核心逻辑,生数科技提出通用世界模型从 L1 到 L5 的五级演进路线,依次为生成模拟世界、实时空间交互、物理动作决策、自主世界智能体、多体世界组织者。

图为生数科技联合创始人兼 CEO 骆怡航发表主题演讲。中国经济网记者 李月华 摄

论坛现场,骆怡航正式发布面向机器人灵巧操作的自进化通用世界模型 Motus2。他表示,灵巧操作是世界模型进入物理世界的严苛考验,Motus2 探索的正是从 L3" 在世界中行动 " 走向 L4" 自主世界智能体 " 的关键跨越——让模型具备自主评估、改进行动的闭环能力。

大晓机器人董事长、商汤科技联合创始人兼执行董事王晓刚介绍了 " 开悟世界模型 " 理解、生成、预测的一体化架构:通过理解模块判断环境与任务状态,通过生成模块推演不同动作的潜在后果,再通过预测模块支撑机器人实时控制,三种能力协同形成自我反馈闭环。

图为大晓机器人董事长、商汤科技联合创始人兼执行董事王晓刚发表主题演讲。中国经济网记者 李月华 摄

圆桌对话环节由香港大学计算与数据科学学院罗平主持,忆生科技联合创始人兼 CTO、香港大学计算与数据科学学院助理教授杨言超,瞬适科技创始人、上海科技大学研究员、YesAI 实验室负责人石野,极佳视界联合创始人、首席科学家、通用世界模型北京市重点实验室主任朱政,以及源策未来联合创始人兼 CEO 李天羽四位嘉宾参与讨论。

图为圆桌对话环节现场。中国经济网记者 李月华 摄

什么才算真正的世界模型?

世界模型的定义与能力边界,是本次论坛探讨的首个核心议题。李天羽认为,面向具身落地的世界模型,更应关注策略系统或机器人本体能否与模型形成高效交互。

朱政看好视频生成路线在数据、架构与训练方法上的成熟积累,同时也提到对于具身智能而言,世界模型不能只关注视觉层面,还需要统筹大脑决策、小脑运动控制与灵巧手操作协同。

石野认为,传统物理仿真与数据驱动的世界模型具有天然互补性:" 物理仿真天生具有物理信息与规律,世界模型则天生擅长吸收真实世界的变化规律。"

杨言超则提出了更严格的三条判定标准:第一,能够理解并预测未来状态;第二,能够从数据中抓取可预测的结构、形成稳定记忆;第三,能够依托记忆实现持续自我进化。" 从这个标准来看,当前的视频生成模型包括 VLA,都具备预测能力,但在抓取结构化记忆、形成持续进化机制方面,仍存在明显短板。"

" 生成 " 不等于 " 理解 "

谈及 AI 模型的能力,杨言超用通俗的语言说,当前模型生成高清图片、视频的能力,甚至可以超过 3 岁儿童;但 3 岁孩子面对新玩具时,大人演示一遍,孩子多看几次、多试几次就能学会操作,这种学习能力恰恰是当前 AI 模型不具备的。

" 物理 AI 的容错率极低。" 李天羽分析,物理场景的真实部署对系统持续运行的可靠性要求极高,这需要模型对环境形成更深层的理解,而非停留在表面生成效果。

石野则以倒水、倒茶的场景举例说明,学会动作轨迹不等于理解任务本质。" 如果原本采集的是往咖啡杯倒水的数据,哪天告诉它往咖啡杯里倒茶,它依然可能把液体倒到错误的位置。"

当被问及世界模型被高估的部分,杨言超说,不能把 " 生成准确 " 等同于 " 理解正确 "。他结合研究指出,模型的监督信号建立在像素层面,但像素生成完美不等于任务执行正确。" 我们的研究与试验显示,模型生成视频的质量,和指导机器人物理交互的正确率之间没有关联。"

哪些场景更需要世界模型?

落地场景的价值判断,直接关系着世界模型的商业化前景。朱政将商业化闭环视为最大挑战:" 展望未来 5 年,世界模型最大的风险,就是商业化闭环究竟能不能走通——能否找到明确的付费需求,并用收入和融资支撑下一代研发迭代。"

石野认为,世界模型的内涵与技术范式还会持续演进,更多模态的加入在提升能力上限的同时,也会带来算力、数据等额外负担," 上限很高,但下限也可能很低 "。部分工业任务不仅采集数据昂贵,重置环境的成本也很高,世界模型可以在这些环节有效降本增效。

杨言超提出两个核心考察维度:试错代价与训练数据获取成本。" 如果任务试错代价极高、数据获取成本也极高,正是世界模型大展拳脚的场景;如果试错成本低、数据易获取,比如普通抓取操作,未必每次决策都要调用世界模型。" 在他看来,关键不在于全程调用世界模型,而在于判断何时调用能实现价值最大化。

" 家庭环境下,我们对世界模型的需求非常强。" 在朱政看来,家庭场景的任务与操作对象多变,更需要模型通过少量演示快速适应;而短期内任务相对固定的工业、零售场景,VLA 结合预训练与后训练已有一定的解决能力,世界模型的必要性需要结合成本具体判断。

论坛尾声,罗平总结道:" 世界模型或许不是通往物理智能的唯一门票,但它是目前人类赋予机器空间想象力、常识推演与行动预测最具希望的核心基建。"(记者 李月华)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

物理 创始人 香港大学 机器人 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论