机器人会打网球、会转笔、会做早餐,是否意味着具身智能已经接近真正的通用化?
银河通用创始人兼首席技术官王鹤的答案是,单项任务的成功只能证明技术能力可行,真正决定产业是否迎来拐点的,是这些能力能否跨场景、跨任务、跨本体复用,并以足够低的成本部署到真实环境。
8 月 19 日 -23 日举行的世界机器人大会(WRC 2026)期间,王鹤在银河通用主办的《具身智能大模型的进化之路:从技术分级到产业落地》论坛上发表演讲时表示,单点能力只是具身智能的第一步,下一阶段的竞争将转向通用模型、数据基础设施和规模化部署能力。
银河通用把具身智能的发展划分为四个阶段。第一阶段,在复杂运动项目中达到人类业余水平的 "AlphaGo 时刻 ";第二阶段,建立统一模型和数据范式的 "GPT-2 时刻 ";第三阶段,能够在多样化环境中完成广泛任务的 "ChatGPT 时刻 ";第四阶段,最终在物理世界和认知领域全面超越人类的 "AGI 时刻 "。
在王鹤看来,通用化的关键,是将机器人的 " 大脑 " 与 " 小脑 " 连接起来。其中,大脑负责理解环境、解析任务语义和进行长程规划;小脑负责将高层意图转换成实时、精确、可靠的全身动作。两者之间还需要一个 " 脑桥 ",把低频的任务决策与高频的运动控制连接起来。
这一分层回应了具身智能长期面临的一项矛盾——负责理解和规划的大模型通常推理频率较低,而机器人与物理世界交互需要百赫兹级的实时反馈。仅靠一个端到端模型,很难同时处理长程推理和精细控制。
为解决 " 大脑 " 的通用化问题,银河通用提出世界动作模型 WAM,将 VLA 的动作生成能力与世界模型的环境理解和预测能力结合起来。银河通用称,其 AstraBrain-WAM 0.5 能够融合仿真、真机和人类行为数据,并在跨场景、跨本体和多任务操作中实现能力迁移。
在 " 小脑 " 一侧,银河通用推出 AstraBrain-WBC 0.5 通用小脑基座模型,通过大规模人类运动数据学习,将人的运动意图迁移到不同的人形机器人本体上。
如果这一路线成立,机器人运动控制将不再依赖为每一种动作单独训练一套策略,而可以逐渐形成类似基础模型的能力,增加数据和模型规模后,获得更强的零样本运动泛化能力。
对于行业频繁讨论的具身智能 "ChatGPT 时刻 ",银河通用给出了更具体的能力基准。第一,机器人应当具备零样本泛化能力。在不进行任务特定工程开发的情况下,面对人类常见任务能够达到 70% 至 80% 的成功率。第二,机器人系统必须足够容易部署。客户不需要拥有专业的 AI 团队,只需采集少量现场数据并完成轻量级后训练,便能将成功率提高到接近实际使用要求。
这个定义把 " 技术演示 " 和 " 产业产品 " 区分开来。客户真正关心的,是机器人进入一个从未见过的场景后,是否能够直接工作;出现新任务时,是否需要重新组织一支算法团队;场景发生变化后,能否快速恢复。
为解决模型进入新场景后的适配问题,银河通用提出 WAM-TTT,即 World-Action Model Test-Time Training。WAM-TTT 希望依靠人类第一视角视频完成场景适配,无需重新采集机器人动作数据,也无需进行动作标注。其基本流程是:模型先完成基础训练;进入客户现场后,由人类在真实环境中示范任务;系统从人类视频中学习场景、物体和任务信息,再把相应能力迁移到机器人上。
这一方法真正解决的是具身智能的边际部署成本。如果每进入一家工厂、一家门店或一个家庭,都要重新采集大量机器人数据并开展数周训练,那么通用模型仍然只是一个昂贵的项目制工具。只有把适配过程压缩到普通用户也可以完成,机器人能力才可能像软件一样规模化复制。
具身智能的另一项难题,是缺少类似互联网文本的海量标准化数据。银河通用构建了 AstraData 数据基础设施,覆盖人类动作数据、合成仿真数据、真机遥操作数据和真实部署回流数据,并配套推出采集设备、仿真平台和可视化数据管理系统。
银河通用披露,其AstraData 体系已覆盖超过 100 万小时人类动作数据,其中包括高精度 UMI 数据和第一视角人手数据;真机遥操作数据的日产能达到 1500 小时,真实场景回流数据超过 8 万小时。
不过,银河通用强调,数据规模本身并不是目标。并非所有数据皆具训练价值,只有能够提高模型真实任务表现的数据,才是有价值的数据;反之,只有经过真实场景部署和验证的模型,才能证明其有效性。
这意味着具身智能的数据竞争将不只是 " 谁采得更多 ",而是" 谁能建立数据—模型—部署—回流的闭环 "。训练数据提升模型能力,模型进入真实场景产生新的反馈,反馈再用于筛选和优化训练数据。只有当这一飞轮持续运转,具身模型才可能随着部署规模扩大而不断进化。
以下为「明亮公司」整理的王鹤以《推动具身智能与人形机器人的核心突破时刻》为题的演讲内容(未经演讲人审阅):
#01 从「AlphaGo 时刻」走向通用具身智能
今天,我想和大家探讨一个问题,如何推动具身智能和人形机器人实现技术突破,并真正走向通用。
我们认为,要实现人形机器人的通用化,需要具备两个核心条件:一是能够完成不同任务的通用硬件本体;二是能够驱动本体完成复杂任务的通用机器人 " 大脑 "。
过去一段时间,全球科技界都在关注机器人运动能力的进步。我们把机器人在复杂运动任务中达到人类业余水平,称为具身智能的 "AlphaGo 时刻 "。
今年,我们展示了人形机器人自主打网球的能力。网球是一项非常复杂的运动。机器人不仅需要保持身体平衡,还需要完成实时移动、挥拍、击球和回位;它既要控制全身,也要精确控制手腕和球拍,同时还要判断来球轨迹、落点与速度。
这些动作不是预先编排好的,机器人需要感知对手的击球,根据球的状态实时完成全身运动规划,并连续处理多回合交互。
我们实现了人形机器人与人类进行多回合自主对打。这项工作发布后,在全球科技社区引起了广泛关注,也得到了包括 Elon Musk 在内的科技界人士回应。
我们能够实现这项能力,重要原因之一是仿真强化学习。机器人可以在仿真环境中进行大规模训练,相当于在很短时间内积累人类上万年的练习经验。通过解决仿真到真实世界的迁移问题,机器人在现实环境中也能够完成复杂的动态运动。
除网球之外,我们还探索了灵巧手的复杂操作。在此前的春节联欢晚会中,机器人完成了手中转核桃的动作。这类任务涉及密集接触,不能仅依赖固定轨迹。两个核桃之间、核桃与手指之间的接触状态会持续变化,任何一个细小误差都可能导致任务失败。
要完成这样的操作,模型必须学习物体与手之间的动力学关系,并在真实环境中根据反馈不断修正动作。我们采用了仿真强化学习与真实数据反馈结合的方法,使机器人能够逐步掌握这类高难度灵巧操作。
我们还实现了机器人在真实环境中转笔。过去的一些方案只能在仿真中完成,而我们希望这些能力最终能够进入真实物理世界。接下来,我们还会继续探索更多不同姿态和不同方式的转笔动作。
网球、转笔和转核桃都是复杂任务,但这些仍然只是单项能力。真正的具身通用智能,不能只在一个任务上表现出色,而要把这些能力迁移到更多任务、更多场景和更多机器人本体。因此,机器人需要从 " 专才 " 走向 " 通才 "。
我们认为,通用人形机器人需要同时具备通用大脑和通用小脑。
通用大脑负责理解世界、理解人的指令、规划长期任务,并决定接下来应该做什么;通用小脑负责把高层任务转化成快速、精准和稳定的动作。
两者处理问题的时间尺度不同。大脑可能以每秒数次的频率进行任务理解和规划,而小脑需要以每秒数百次的频率控制机器人的身体。中间还需要一个脑桥,把大脑产生的高层动作意图传递给小脑。我们将这套系统称为 " 银河星脑 "AstraBrain。
在大脑层面,我们面临的核心问题是如何定义适合机器人使用的基础模型范式。过去比较主流的方向是 VLA,也就是视觉—语言—动作模型。VLA 可以根据视觉输入和语言指令直接输出机器人动作,但它依赖带有机器人动作标签的数据。
机器人数据与语言数据不同。互联网天然存在大量文本和图像,但机器人动作数据需要通过真机、遥操作或者仿真单独采集,成本很高,而且容易受到机器人本体结构的限制。
另一个重要方向是世界模型。世界模型能够从大量视频和人类数据中学习环境变化规律,并预测未来可能发生什么。但是,传统世界模型主要负责理解和预测,并不直接生成机器人动作。
因此,我们提出世界动作模型 WAM,也就是 World Action Model。WAM 希望把 VLA 的动作生成能力和世界模型的环境理解能力结合起来,让同一个模型既能够理解世界、预测动作后果,也能够直接生成机器人的动作。
我们希望 WAM 能够吸收多种类型的数据,包括仿真数据、真实机器人数据、人类行为数据、高质量数据、低质量数据、有动作标签的数据和无动作标签的数据。只有这样,机器人模型才可能摆脱对单一本体和单一数据来源的依赖。
#02 WAM 如何实现跨场景、跨本体和多任务泛化
我们推出的 AstraBrain-WAM 0.5,目标是实现跨场景、跨本体和多任务的操作能力。一个重要变化是,我们不再只在像素空间中学习,真实场景中的光照、纹理、背景和物体外观经常变化,如果模型直接依赖像素信息,环境发生轻微变化,就可能影响动作预测。
因此,我们让模型在潜在空间中学习更稳定的物理和动作表示,过滤掉与任务无关的信息,把注意力集中在物体结构、空间关系、接触状态和动作后果上。我们的训练数据包括高质量机器人动作数据,也包括存在噪声或者动作并不完美的数据,还包括人类第一视角视频。
人类视频通常没有机器人动作标签,但其中包含了大量对物体操作和环境变化的知识。如果模型能够从这些视频中学习动作之前和动作之后的状态变化,就可以把人类数据转化为机器人可利用的训练资源。
实验中,我们看到随着训练数据规模和模型规模增加,模型的动作预测误差持续下降。这说明世界动作模型同样可能存在 Scaling Law。
在模型预训练的基础上,我们还使用真实机器人强化学习进行后训练。例如在机器人制作早餐的任务中,任务链条很长,环境中还可能不断出现干扰。机器人需要抓取餐具、处理食材并完成多个连续步骤。如果其中一个步骤失败,后续任务就可能全部中断。
经过真机强化学习后训练,机器人能够在受到一次或者多次干扰后继续完成任务。我们还在继续提高任务长度,希望机器人能够自主完成持续十分钟以上的早餐制作任务。
这类能力与提前编排动作有本质区别。机器人不是机械地执行固定轨迹,而是在任务过程中持续感知环境、判断状态并调整动作。
#03 通用小脑让人的运动能力迁移到机器人
除了负责认知和规划的大脑,机器人还需要通用小脑。我们推出了 AstraBrain-WBC 0.5 通用小脑基座模型,希望机器人能够从大规模人类运动数据中学习全身控制能力。
人类可以自然地完成走路、跑步、弯腰、转身和伸手等动作。对机器人而言,每一个动作都涉及全身关节协调、动态平衡和实时反馈。传统方法通常为每一种动作单独训练策略,训练成本高,而且难以迁移到新动作和新本体。
通用小脑的目标,是学习人的运动意图和身体协调规律,再将这些规律映射到机器人本体上。在我们的演示中,同一套系统可以驱动不同的人形机器人完成动作,也可以根据训练数据中相近的运动模式,对没有见过的动作进行泛化。
随着人类运动数据从百万帧扩展到更大的规模,模型的零样本运动误差持续降低。我们认为,小脑模型同样具备通过数据和模型规模持续提升的可能性。
未来,机器人在面对应急救援、消防、消杀等场景时,需要根据人的意图快速获得相应的运动能力。通用小脑可以降低每一种新动作都从头训练的成本。
#04 如何定义具身智能的「ChatGPT 时刻」
行业经常讨论具身智能什么时候会迎来 "ChatGPT 时刻 "。我们认为,需要先给出一个相对明确的能力标准。
在数字智能领域,ChatGPT 最重要的特点之一是零样本泛化。用户不需要为每一个问题重新训练模型,只需要通过自然语言提出需求,模型就能够完成大量日常任务。具身智能也应该达到类似水平:
第一,在不进行任务特定工程开发的前提下,机器人对于人类常见任务应当具备零样本泛化能力,并达到 70% 至 80% 的成功率。这里强调的是不针对单个任务重新编写规则、不采集大规模专项数据,也不重新设计整套系统。
具身模型必须容易使用和部署。客户不应该必须拥有一支专业的人工智能团队,才能让机器人适应新场景。理想情况下,客户可以采集少量现场数据,上传系统并完成轻量级后训练,把任务成功率进一步提高到接近 100%。整个适配过程应当压缩到一天至一周,而不是持续几个月。
如果机器人能够达到这两个标准,就意味着它不再是为一个任务定制的自动化设备,而开始具备真正的通用产品属性。
#05 WAM-TTT:只用人类视频完成场景适配
为了进一步降低模型部署成本,我们提出 WAM-TTT,也就是 World-Action Model Test-Time Training。
传统后训练通常需要机器人在目标场景中采集动作数据。这个过程不仅成本高,而且存在安全风险。WAM-TTT 希望在部署阶段只使用人类第一视角视频,不需要机器人动作标签。
人先在目标场景中完成任务,模型通过视频理解环境、物体、操作顺序和任务结果,再把相应技能迁移到机器人上。这种方式有三个特点,只需要人类数据,不需要动作标注,并且可以通过少量专用参数进行快速学习。
我们的目标是让机器人进入新的客户场景后,不再依赖大规模重新采集真机数据,而是让现场人员通过自然示范帮助机器人完成适配。只有把部署过程变得足够简单,通用模型才可能真正进入不同工厂、门店和家庭。
模型的持续进步离不开数据,但并不是所有数据都具有相同的训练价值。
我们构建了 AstraData 数据基础设施,覆盖人类动作数据、合成仿真数据、真机遥操作数据和真实部署回流数据。
在人类动作数据方面,我们从 2021 年开始布局第一视角人类—物体交互数据,并发布了 HOI4D 数据集。此后,我们继续建设更大规模的人类动作数据体系。
我们推出了 Astra Set 数据采集设备,包括第一视角环境感知终端 Astra EGO 和精细操作数据采集设备 Astra UMI,用于记录人的视角、手部动作、空间轨迹和物体交互信息。
目前,AstraData 支持超过 100 万小时的人类动作数据,其中包括 50 万小时高精度 UMI 数据和 50 万小时第一视角人手数据。
在合成数据方面,我们建设了 AstraSynth 合成数据平台,整合场景、物体、机器人本体、物理仿真和渲染工具,用于批量生成机器人训练所需的数据。
在真机数据方面,我们在多个城市建设遥操作数据采集能力,日产能达到 1500 小时。在真实部署端,已经积累超过 8 万小时的真机回流数据。
我们认为,数据的价值不能只通过数量判断。有些数据规模很大,但无法提高模型在真实任务中的表现;有些数据数量有限,却能帮助模型解决关键失败模式。
因此,只有经过真实场景验证的模型,才是有用的模型;只有经过大规模模型训练和部署验证的数据,才是有用的数据。
我们希望形成一个持续循环:数据用于训练模型,模型进入真实环境执行任务,部署过程产生新的反馈和数据,再利用这些数据继续优化模型。只有形成这样的闭环,具身智能才可能随着部署规模扩大而不断进化。
#06 从模型能力走向产业生态
具身智能不可能由一家公司独立完成。我们正在推动开放生态建设,希望更多开发者、科研机构和产业伙伴参与模型、数据、应用和工具开发。
我们希望把机器人本体、银河星脑、数据基础设施和开发工具逐步开放给合作伙伴,让更多开发者能够在此基础上构建新的任务与应用。
回到今天演讲的主题,具身智能正在从单项能力验证走向通用基础模型,从实验室演示走向真实产业部署。
我们已经看到了复杂运动和灵巧操作的 "AlphaGo 时刻 ",正在建设统一模型与数据范式,也在向具身智能的 "ChatGPT 时刻 " 迈进。未来,机器人需要理解环境、制定计划、完成行动,并在真实世界中持续学习和进化。
只有当这些能力能够以低成本、可复制的方式进入工厂、商业场景和家庭,具身智能才真正具备推动新一轮产业变革的基础。我们相信,具身大模型将成为人形机器人走向通用的关键,也将推动智能从数字世界进一步进入物理世界。


登录后才可以发布评论哦
打开小程序可以发布评论哦