8 月 21 日,2026 世界机器人大会主论坛上,进行了一场关于 " 世界模型到服务人类的现实距离 " 圆桌对话。就在这场对话开始前,中国电子学会世界模型专家委员会宣布正式成立,中国工程院院士、之江实验室主任王坚出任主任委员。这一动作强化了一个信号:世界模型——这个被寄望于让 AI 真正理解物理世界的核心技术,正从学术概念走向产业共识。
世界模型被公认为具身智能走向落地的 " 核心基座 ",但它究竟卡在哪里?正如浙江人形机器人创新中心首席科学家熊蓉在演讲中指出的—— " 物理世界具有不可约简性 ",这就是世界模型当前面临的困境。结合大会多位嘉宾的观点,世界模型从实验室走向现实必须跨越三道坎。
世界模型不是大模型的延伸
要理解世界模型的卡点,首先要厘清一个认知误区:世界模型不是大语言模型的延伸。
大语言模型基于互联网文本数据训练,擅长语言理解和生成,但它不理解物理世界。它知道 " 杯子 " 这个词,但不知道杯子是圆的、易碎的、会被打翻的。
世界模型则要让机器人理解物理世界,理解空间关系、物体属性、因果推理和行动后果。
奥比中光创始人黄源浩提出,大语言模型只能做语音交互,GPT 指向 " 诗和远方 ",世界模型才能落地干活;" 干活 " 这件事需要空间智能,也需要视觉、触觉等高质量同步数据作为训练养料。大晓机器人董事长、商汤科技联合创始人王晓刚将世界模型的发展划分为三个阶段:第一阶段是数据增强,通过世界模型生成多样化训练数据;第二阶段是仿真闭环,结合机器人控制在虚拟环境中试错;第三阶段是具身智能,让机器人真正感知、理解物理世界并指导行动。
从嘉宾发言看,行业目前仍处于第一阶段向第二阶段过渡的进程中。要达到第三阶段,至少面临三大卡点。
卡点一:真实世界数据的获取成本
世界模型落地的第一道坎是数据。世界模型需要大量真实世界数据来训练——不是互联网上的图片和文本,而是来自传感器、摄像头、机器人本体的多模态物理数据。
问题在于,这类数据的获取成本极高。
数据问题有多棘手?熊蓉直言——低成本、大规模、高质量。她指出,目前已有多渠道的数据采集方法,但如何提升数据质量,仍需持续优化。
英特尔物理 AI 与机器人业务总经理 Nagesh Puppala 也提出了类似观点:" 物理 AI 需要传感器数据、真实世界数据,而不仅仅是互联网数据。"
这与大模型的训练逻辑截然不同。大模型可以从互联网上抓取海量文本,但世界模型的数据必须来自真实物理环境——机器人在工厂里抓取物体的力反馈、在仓库里行走的视觉流、在装配线上操作的运动轨迹……这些数据采集成本高、标注难度大、隐私约束多。
如何低成本获取大规模高质量的真实世界数据,是世界模型面临的第一道坎。
卡点二:Sim2Real ——仿真与真实的鸿沟
但有了数据,不等于模型就能直接可用。第二个卡点,来自仿真与真实之间的鸿沟。在仿真环境中训练的模型,部署到真实世界后往往表现不佳。这就是业界常说的 "Sim2Real"(即 simulation to reality)问题——在仿真里面去学习,就会面临仿真和现实的鸿沟。"
为什么仿真训练出来的模型,到真实世界会 " 水土不服 "?

2026 世界机器人大会奥比中光展台。图片来源:奥比中光官网
熊蓉分析了深层原因:" 物理世界具有不可约简性。我们的专家模型无法用一套总结学习出来的规则去描述物理世界的复杂性。同样,现在的数据和模型能力,也没办法让它涵盖物理世界的丰富性和复杂性。"
具体而言,仿真环境很难完整复刻真实世界的物理规律——摩擦力、弹性、流体动力学的模拟都存在近似误差;现实里的光照变化、物体遮挡、环境反射又会给传感器带来噪声和不确定性;现实中大量长尾、罕见场景,也很难在仿真环境中全部穷举。
为解决这一问题,业界正在探索多条路径。浙江人形机器人创新中心提出了 "Real → Sim → Real 数据飞轮 " 方案:先在真实环境中采集数据,通过高保真重构导入仿真环境,在仿真中增强训练,再部署到真实环境进行校正。
熊蓉也提出 " 噪声注入训练 " 的思路——在仿真环境中主动向传感器数据注入光照变化、运动模糊、物体遮挡等各种噪声,使模型学会在不确定的环境中做出鲁棒决策。
但这些方法仍处于探索阶段。Sim2Real 的鸿沟,是世界模型走向落地的核心障碍。
卡点三:感知与表征——从看世界到懂世界
世界模型的第三道坎,在于 " 理解 "。即便拿到了数据、跨过了仿真与真实的鸿沟,模型仍要真正 " 懂 " 物理世界——而这恰恰是当前世界模型表征层与感知层共同的短板。
今天的多数世界模型,本质上是 " 看世界 " 而非 " 感受世界 "。它们靠视觉表征学习,能识别物体的形状和位置,却难以表达物理交互的本质。熊蓉在主题演讲中指出,具身智能的核心在于与环境发生交互,这种交互 " 并不仅仅体现在视觉上面 "," 交互一定涉及力触觉,并且这种力触觉会跟形状、重量、材质、行为都是强相关的 ",仅靠视觉很难还原这种物理交互的本质。
XELA Robotics 的 Alexander Schmitz 也强调:" 视觉数据不足以抓取和操作物体,需要触觉数据来解决这个问题。" 这意味着,抓取、装配、插入这类物理交互,依赖的恰恰不是 " 看见 " 而是 " 感受 "。业界正在探索将视觉、力觉、触觉融合的通用表征方法,但距离成熟落地仍有距离。

搭载 XELA uSkin 触觉传感器的灵巧手。图片来源:XELA Robotics 官网
更进一步,模型即便 " 看见 " 了环境,也未必 " 理解 "。熊蓉直言,语言视觉大模型 " 缺乏空间理解和物理常识,在开放混杂场景下精准性显著下降 "," 当它看不清、测不准的时候,就会直接影响行为的生成 "。
无界动力创始人张玉峰谈到,世界模型的核心不仅是看到物体,更要理解物体的物理属性以及如何与之交互。但从 3D 空间感知到完备的物理常识,感知层要走的路还很长。
表征与感知这两层一旦补全,世界模型才真正从 " 看世界 " 走向 " 懂世界 " ——而这,也是它服务人类的前提。
卡点虽多,并不意味着中国在这一领域没有机会:中国已有近 200 家人形机器人整机企业,服装仓签约百台级、服装细分领域拿下 2000 台订单,这些正在运行的机器人,既是世界模型的使用者,也是其数据源。
世界模型不是大语言模型的延伸,而是一场关于物理世界认知的范式革命。它的难度远超语言理解,但它的价值也远超语言理解。卡点即机会——谁先突破这些卡点,谁就有机会在具身智能时代占据先机。


登录后才可以发布评论哦
打开小程序可以发布评论哦