机器人学会 " 三思而后行 ",还要翻越三道墙
作者/ IT 时报 沈毅斌
编辑/ 潘少颖 孙妍
想象这样一个场景:你对机器人说 " 帮我把洗衣机里的衣服拿出来晾晒 ",它看了看洗衣机的门,规划手臂的开门轨迹,缓缓打开舱门,发现衣物缠在一起,它停顿思考一下,重新调整策略,将缠绕的衣物一件件抽出,整理好挂在晾衣杆上。
这个场景之所以令人兴奋,不是因为机器人 " 做到了 ",而是因为它 " 想到了 "。它是在理解世界、预测后果、调整行动。这就是世界模型想要实现的东西:让机器像人一样,在行动之前先在脑海里推演一遍 " 我这么做,是否符合这个世界的物理规律 "。
2026 年被视为具身智能部署元年,在 2026 世界人工智能大会上,具身智能企业不再像此前展现机器人的 " 舞蹈功底 ",转而将真实产线搬到展台。
机器人如何感知环境、理解任务、执行动作,并在真实反馈中持续进化?世界模型、物理 AI 的 "ChatGPT 时刻 " 还有多远?大家都在追逐机器人场景落地,但对于 " 终点前的最后一段路该怎么走 ",业界还有许多不同的观点。
数据困境
不同方式翻越 " 三道墙 "
世界模型的本质是什么?" 能够理解物理世界运行规律的 AI 系统 ",智元合伙人、高级副总裁、具身业务部总裁、觅蜂科技董事长兼 CEO 姚卯青给出这样的看法,其中最重要的功能是 " 能够预测世界的下一步状态 "。他认为,世界模型需要掌握三项关键能力:多模态融合理解,能准确感知环境的变化;物理规律认知,涵盖动力学及时空理解;因果推理,具备长时序推理而不崩坏的能力。从 " 看到了什么 " 到 " 世界会怎样变化 " 再到 " 如果我这么做会怎样 ",构成一条完整的智能链条。
然而,训练这样一个模型所需的数据,与现实能提供的数据之间横亘着巨大的鸿沟。
在 " 智启具身论坛 2026:迎接物理 AI 智能涌现 " 分论坛上,姚卯青坦言,语言模型头部团队已经用到了 100 万亿 Tokens 的语料,约合 100 亿小时的人类说话时长。而具身智能所需的物理世界数据,信息密度远低于语言,目前还差了万倍以上。这便是物理智能要实现规模化,必须突破的第一道 " 数据墙 "。
除此之外,姚卯青还表示,理解物理 AI 要回到智能的两条主线:表征与闭环。但跨任务、跨场景、跨本体的统一物理表征尚未形成," 表征墙 " 还没有打通;真实试错代价昂贵、反馈缓慢,难以规模化," 闭环墙 " 也是阻碍。
围绕数据来源,不同企业也给出了不同的解法。
Sunday Robotics 联合创始人兼 CEO 赵子豪介绍一种低成本、无本体差异的采集方式 UMI(通用操作接口)数据。在他看来,这是短期提升智能最有效的手段。但 Physical Intelligence 研究科学家任至意则坚持真机数据的不可替代性," 只有真机采集的数据,才能在机器人上完整复现任务 "。两种观点各有立场,一方追求数量与效率,一方坚守质量与可靠性。
Dyna Robotics 联合创始人马也骋给出另一种视角。" 把部署数据放到下一轮预训练中,会让后续部署越来越高效,但前提是,预训练阶段的海量高多样性数据必须做扎实。" 他提出 " 数据金字塔 " 方案把互联网视频、第一人称数据、真机数据、部署回流数据分为三层,各司其职。
这场关于数据的讨论,暗示着一个事实:没有任何单一来源能解决物理 AI 的数据饥渴难题。
模型争辩
VLA 已死,WAM 是未来?
尽管大模型智能程度越来越高,但不少具身智能从业者发现,这条路径或许不能直接平移到物理 AI 领域,甚至网上冒出 "VLA(视觉 - 语言 - 动作模型)已死,World Action Model 是(世界动作模型 WAM)当立 " 的言论。
任至意的回应很直接:" 到目前为止,没有看到哪家能做到比 π 0.7(Physical Intelligence 发布的通用机器人 VLA 模型)更亮眼的 demo,所以 VLA 还没有死。" 但他也承认,VLA 和 WAM 并不冲突,未来真正要做的是训练一个原生理解 context、知道怎么生成未来的模型。
这番表态看似中立,实则暗含一个判断:与其争论路线,不如先做出能被行业公认的成果。π 0.7 仅通过在 ARX 机械臂上训练,就能零适配地在 UR5 双臂机器人上完成同款操作,实现跨本体迁移上的突破。
马也骋的视角来自不同的实战经验。Dyna 已经从 VLA 切换到 WAM 架构,因为他发现在部分强调高成功率和少数据效率的任务中,WAM 可能比 VLA 更高效。这是 Dyna 在餐巾折叠等真实商业场景中被 " 逼出来 " 的 " 生存智慧 ":通用模型不够可靠,专用模型不够可扩展,他们选择了一条中间路线,用世界模型的预测能力来驱动高频执行,用低频的推理模型来处理高层认知。
腾讯首席科学家张正友的视角更宏观。他认为具身智能尚处于早期阶段,还没有像大语言模型的 Transformer 那样收敛的统一框架。" 假如具身智能真正是一个智能体,怎么可能只有 3B、4B 的模型就能解决所有问题?" 他提出的认知系统、感知行动系统、底层反应系统三层架构,信息在层间双向传递,更像一个完整的 Agent 系统,而非单一的 VLA 或 WAM。" 大语言模型都是几百 B、上千 B 的,具身智能要达到 AGI 级别的智能,肯定不能只靠几百 B 的模型直接控制运动。"
姚卯青认为,VLA 与 WAM 两条路线都需要持续演进,并推动二者走向统一,下一代模型将是 WRAM(世界推理动作大模型 World Reasoning Action Model)。对此,智元推出自研 GO-2 基座模型、Act2Goal 世界模型、GE-Sim2.0 等多款 VLA 与 WAM 模型,搭配 SOP(标准操作流程)、Genie Evolver 百台级分布式真机强化学习体系,从算法、仿真、真机训练层面打通规模化迭代闭环。
场景验证
最快两年迎来机器人
"ChatGPT 时刻 "
如何把数据、训练、部署串成一个持续运转的系统,是世界模型落地验证绕不开的核心命题,它关乎物理 AI 能否从 " 想清楚 " 真正走向 " 干出来 "。
训练效率是第一个被攻克的工程瓶颈。传统的强化学习依赖单台机器人在真实环境中反复试错,迭代周期以 " 天 " 为单位,成本极高。智元提出 " 预训练—后训练—持续学习 " 的三阶段训练架构,即预训练阶段,通过海量异构数据让模型具备通用的物理世界认知;后训练阶段,针对具体场景进行精细化微调,解决落地性能;持续学习阶段,则依靠部署回流的数据,让模型在实际运行中不断迭代升级。
智元在嘉兴搭建的 Genie Evolver 系统,实现超过 100 台机器人同时进行在线策略迭代训练。机器人集群实时上报交互数据,云端完成模型更新后,权重可在 2 秒内下发到所有机器人,训练周期压缩到 " 分钟级 "。
无界动力选择了另一条路径,其联合创始人兼 CTO 夏中谱在世界模型 " 六小龙 " 巅峰论坛上详细阐释了 " 隐空间世界模型 + 强化学习 " 双轮驱动的技术思路:以隐空间世界模型建立 " 世界观 ",认知客观世界的物理规律与因果关系;以强化学习塑造 " 价值观 ",基于高频试错将对物理世界的理解沉淀为精准执行策略。
在他看来,世界模型与强化学习的深度结合,将是推动整个行业跨越范式拐点的最大突破口。这条路线不依赖在像素空间里生成逼真视频来 " 理解 " 世界,而是在压缩后的隐空间里完成对未来状态的推演,再通过强化学习把推演转化为行动。
物理世界的动态变化瞬息万变,模型的推理效率就成为决定机器人能否顺利完成现实中动态任务的关键。世界模型 " 六小龙 " 巅峰论坛上,大晓机器人发布的开悟世界模型 3.1,在端侧实现 125 毫秒的推理延迟,这意味着复杂的 " 理解—推演—执行—反思 " 闭环可以在机器人本体上实时完成,无需依赖云端算力。
蚂蚁灵波则展示其世界模型在消费级显卡上达到 90 至 150 赫兹的推理效率,强调 " 从头为物理世界设计 " 的架构在效率上的优势。从云端走向端侧,是物理 AI 从实验室走向真实场景的必经之路。
部署验证是最后一块拼图。智元机器人在江西南昌的 3C 产线上实现 99.99% 的成功率,并已稳定运行数月;Dyna Robotics 在马萨诸塞州一家餐厅里完成了餐巾折叠的商业验证,机器人 24 小时无人干预下自主折叠超过 850 个餐巾,成功率 99.4%;大晓机器人采取 " 先 ToB 后 ToC" 的策略,推出面向即时零售、酒店洗衣、巡检安防的三套方案,其 " 晓满 " 一体化履约方案则已进入烧卖购、快客达等真实零售场景,计划未来一年完成 1000 家零售场景落地。
这些数字和案例的意义在于,它们不再是实验室里的 " 偶发成功 ",而是真实场景中可重复、可验证的证明。
论坛上,业界学者和专家也都给出自己对于机器人 "ChatGPT 时刻 " 的时间预测,姚卯青认为最快是两年;任至意、马也骋判断是四年左右;张正友则估计是三至五年。
行业尺度
缺少一把标准尺子
如果说数据、模型、场景是物理 AI 的 " 内功 ",那么评测标准就是这个行业的 " 度量衡 "。
在世界模型 " 六小龙 " 巅峰论坛的圆桌环节,六位嘉宾都认为,当前没有一个公平、标准、统一的世界模型评测基准。大部分评测仍然停留在视频生成类型上,但这些指标与机器人真正需要的 " 物理因果推演能力 " 之间,存在本质错位。
世界模型的价值在于支持可靠决策,而非仅仅生成视觉连贯但物理不合理的内容。正如自变量机器人 CTO 王浩所说,今天的世界模型 " 可能 99% 的像素对决策毫无用处 ",但行业却花了大量算力去预测这些无用像素。
针对这一痛点,论坛上,具身物理智能统一评测基准平台 Physical IQ 物智亮相,这是国内首个具身原生、面向多场景、多本体、多任务的物理智能评测基准平台。
Physical IQ 物智以统一协议贯通零售、工业、家居等真实场景,平台不限定参赛方使用何种硬件形态或底层算法,所有参与者都在同一套协议下进行公平竞技。重点考察双臂协作、移动与操作协同、长程任务规划、3D 空间推理、工具使用、多机协同等前沿能力维度。
例如,在零售场景中考察货架整理、外卖打包、桌面补货;工业场景聚焦精细分解、工具使用、柔性线材整理;家居任务覆盖刚性与柔性混合物体的厨房清洁、物品整理、表面擦拭;物流任务则针对传送带分拣、快递盒叠放、重型货箱搬运。这些任务的共同特点是:它们不再是脱离实际的 " 玩具级 " 测试,而是直击当前技术痛点的真实业务场景。
在生态共建层面,平台吸引了智元机器人、辉羲智能、蚂蚁灵波等产业链上下游企业共同参与。从发起方、运营方到参赛方,这套覆盖产学研用的完整体系正在逐步构建。
排版/ 季嘉颖
图片/ IT 时报 采访对象
来源/《IT 时报》公众号 vittimes
E N D
大家都在看
IT 时报
怕被 AI 替代?
不如先学会用好它
「挨踢妹 @AI 茶水间」
扫码即可加入↓↓↓
请加「星标」不错过我们


登录后才可以发布评论哦
打开小程序可以发布评论哦