原标题:星动纪元陈建宇:走向具身通用机器人:大脑、本体与场景的协同进化
8 月 20 日,星动纪元创始人、首席执行官陈建宇在 2026 世界机器人大会主论坛 -" 第 2 篇章 应用牵引 " 上发表主旨演讲《走向具身通用机器人:大脑、本体与场景的协同进化》。
以下为部分发言实录,投资界(ID:pedaily2012)整理:
陈建宇:非常感谢主办方的邀请和介绍,在这里跟大家分享一下我们做的相关工作和一些思考。
经过这么几年的发展大家已经意识到通用机器人、人形机器人和具身智能巨大的潜力,它未来一定会成为万亿级超级大的市场。首先它可能带来生产力的变革,它帮我们更好的生产电脑、手机、汽车等等产品。第二步它自己就会成为即终端之后下一代的智能终端产品,可能以某种家用机器人形式存在。
这里面非常重要的关键点是能不能打造更加通用的机器人,这样的机器人具备两个特征。第 一是它的上限更高,它有更高的自由度、更高的智能,所以它能做到很多以前机器人不能做到的很多事情,这样把市场整个去打开。第二它是更加通用的,泛化性更强的,所以我们做新的事情不像以前专用机器人一样重新开发它的硬件和软件,里面绝大部分的东西都是可以直接复用和泛化的。
这里打造通用机器人的话,避不开我们同时做它的大脑和本体。星动纪元围绕这样一个目标,这几年已经实现了通用机器人软硬一体全栈自研多项的突破,包括大脑这块自研的端到端具身大模型、运动控制和双足本体关节和灵巧手,我们把它都很好的整合到了一起。最重要是把大脑、本体和场景,一起协同起来做成一个协同进化的飞轮。
这张图可以展现出来最上面是端到端具身大脑大模型,这里面包括 VLA 世界模型、数据等等,都是在这一部分。它是通用的模型,它能够支配多种本体用到场景里面。中间层是本体,因为我们的具身模型、大脑最终要产生价值,一定要放在某一个本体上才能跟物理世界进行相应的交互,真正去干活,所以这一层也是非常重要的。最终我们可以把它用到各类场景里面。如果我们设计比较得当的话,像大脑是通用的,本体是比较通用的,它用到各类场景里应该都是可以比较通用的用进去。
在场景应用过程中,我们又可以不断获得很多数据的反馈,这个反馈又会进一步反哺大脑的发展,所以通过这样的一种方式可以把技术和商业化很好的协同起来形成协同进化的飞轮。
下面具体讲一讲我们的思路和做法,首先是具身大脑层面,这块我把具身大模型迭代方式迄今为止列成三个范式。第 一个范式是语言模型 + 机器人的控制,这三个范式都是具身大模型的范式,以前相对传统的已经不在这里进行赘述,所有的一切都是从 ChatGPT 大模型开始出现才有的。最开始 ChatGPT 语言大模型出现之后,我们探索的是能不能把语言大模型用在机器人里面,但是整个框架还是传统的模块化机器人框架的思路,但是我们用语言模型增加它上层的推理。
第二阶段是 2023 年以 GPT4 为代表,多模态语言模型出现了,可以把视觉等等融入进来。这个阶段对于具身模型我们作出对应的是 VLA 模型,它是视觉语言动作模型。在多模态模型底座之上,把机器人非常重要的动作和跟环境交互的功能一起融合到统一的模型里面。
第三阶段是世界模型,在 AI 大模型这一侧最早的代表是 2024 年 Sora 第 一代模型,现在 CIDAS 也发展的非常迅速。具身智能这块是基于类似的方法,做出来的世界动作模型,这样的模型它除了能够预测未来产生的动作,还能够预测未来对决策进行闭环。
这三个阶段我们做出了多项引领性的工作,比如说这是我们比较早的时候属于第 一阶段的时候,大概做出全球首 个大语言模型结合人形机器人的工作。它以语言模型作为上层的规划,但下层感知、控制执行还是由机器人传统模块化控制方法去做的。我们很快会意识到,这样传统分层的方法具有它的局限性,因为它把感知、规划、控制、执行都模块化的去做,只是把语言模型替代了最上层的规划。这里面模块之间特征和接口都是人工去定义的,这里也没法对它进行端到端的训练。不管是语言模型还是视觉模型都经过从模块化人工定义特征到端到端靠数据去 skill 最终取得成功的过程,具身应该沿着类似的范式,这就来到端到端 VLA 模型,它把各种模态世界语言动作融合,或者多个层面的功能,把感知、决策、规划、控制融到一个模型里面,这样可以把大量数据 skill 起来。
现在典型 VLA 模型有很多出名的,比如说 π 0 系列、Grok、Helix,这些 VLA 模型统一的范式是以多模态语言模型为底座,再加上 Action Aspen 或者是 Action Head,把它端到端来去训练。这样的范式在历史上最早作为公开论文发表,2024 年发表了这样一篇工作。
现在我们为什么认为还需要做世界模型呢?这要说到典型的 VLA 模型的局限性,它的局限性在于学习方法上。它非常好的一点是我们找到一种方法能够把这些模态端到端的用一个模型去训练,并且我们也呈现出了比较好的 data scaling 的效果,但所有方法都是通过模仿学习的,所以我们需要采集大量人为行为,因为采集大量人为行为数据才能模仿形成一定泛化性,但它的泛化性相对有限一些。你要让它学这个事情要给大量数据给,到新的任务没有进行模仿很难直接举一反三泛化下去。世界模型是什么?世界模型要构建对这个物理世界常识性的理解,这个常识性的理解具备比较好的泛化性,比如水杯往下倒水就会往下流等等,你不需要再通过一遍遍去学它的动作,具备一定常识性理解和推理,这是有望大幅提升泛化性的原因。
功能上来看,下边是列的世界动作模型大的输入输出的范式。我们会发现它包含了所有 VLA 的功能,左边输入,上面是它感知的输入,代表了以视觉为代表的感知输入,下面是语言 prompts,这个代表 Language 部分,右边的上面是 action,动作部分也要产生动作,而世界模型多了一部分对物理世界未来演化和发展进行预测。
在具体实现方面,这两者比较大的区别是在智能底座上面。刚才讲到 VLA 智能底座是多模态的语言模型,最 底层的智能内核是语言智能空间。这个空间它的优势是什么?是抽象思维比较强比较泛化,因为是语言空间。但是它的缺点是缺少比较细节物理层面的信息和理解,可能会缺失。
右边是世界动作模型,现在世界动作模型很多是以视频模型为底座,而视频模型直接处理原始的图像、视频包括音频等数据,而原始图像感知数据里包含更丰富的关于物理世界很多细节的东西,而这个智能底座直接能够处理它,所以我们认为它更加适合物理世界操作的具身模型。
沿着这样的思路我们做出了一系列的工作,我们早在 2024 年时发表了世界动作模型的工作,这是全球首 个融合视频预测与动作预测的世界动作模型,这基本上是现在标准世界动作模型的范式,我们比英伟达类似方案早一年左右的时间去发表。
在此基础上我们做了很多改进,比如数据层面用了世界模型之后对数据吸收能力是比较强的,这块提出全球首 个大规模基于人类视频数据,2025 年出来的时候发表论文和世界动作模型合在一起。我们不光加入机器人真机的数据,还把第 一人称人类操作数据加起来一起训练。
这篇是我们跟 Phyics Intelligence 创始人 Chelsea 一起合作的工作 Control work,进一步提高工作行为精准可控性。我们把世界模型用到了真实世界中,有了反馈之后我们还可以对它进行迭代和强化学习,具体的方法不再赘述。
现在展示一下模型一系列的能力,首先是世界模型建模和预测能力,世界模型很大能力是对复杂物理世界进行建模和预测。我左右给了两幅图,一个是世界模型去生成的,一个是真实世界实拍的,这是想让大家猜一猜哪各是生成的哪一个是实拍,几乎是分别不出来的,有一个是生成的有一个是实拍的。通过大量数据和比较好的网络设计,可以让世界模型学习比较精准的预测这些复杂的物理现象,同样的例子还比较多,比如说有毛巾的褶皱,把一张抽纸给抽出来很细微的操作都能够比较好的建模出来,这样对于精细的操作都是比较有利的。
我们做了一些零样本任务泛化的例子,零样本任务泛化是什么意思呢?这是对于泛化终级的追求。任务级的泛化是你完全没有学过类似的任务,现在 VLA 模型可以实现物品泛化,一个物品或者一个物品位置可以泛化,但是新的任务难以实现,如果新的任务没有见过、没有训过、没有收集数据也可以做到。
零样本什么意思?我们到新的任务上不收集数据直接让预训练模型,看它能不能一定程度泛化过去。我们发现比较好的初步结果,在我们自己的办公区随机找一些场景拍摄作为输入,随机给一些任务的指令。图像显示稍微有一点问题,但是可以看到场景的背景是非常复杂多样的,我们给它一系列指令,有的还带着一些逻辑的推理,比如说把左边的拖鞋放到右边,比如把第二个水杯拿起来,比如一堆杂物把胶带拿起来,并且水平方向放到垂直,这是带一些相对复杂的语义理解,它能够端到端把这些行为动作直接预测出来。
再经过比较多的后训练之后,我们可以看到它能做比较精细的操作,比如叠纸盒,比如翻袜子把袜子从里到外翻出来,再比如说拨橘子或者开锁,比较精细的操作是能够做到的。
我们的模型也具备一定跨本体的能力,比如说它能够操作比较复杂的灵巧手,操作灵巧手我们就能做一些工具的使用,比如用螺钉枪打螺钉,你不光拿起来还可以到对应位置甚至用大拇指按下按纽做操作。也获得了一些国际的榜单和奖项。
当我们有了一个不错的大脑之后,也要有与之相匹配比较好的本体,对于通用人形机器人来说,一个是灵巧手,一个是双足,这都是此前没有成熟的产品,还包括灵巧手和双足全身高自由度人形机器人的运动控制,这跟传统机械臂的控制完全不是一回事。所以这一块我们全栈自研了本体硬件体系和运动控制,本体这块从整机再到部件,部件包括了关键模组和灵巧手,再到下面的零件,包括电机、减速器、驱动器,这些都是自己去设计并且达到很高的指标,同时我们也是自研运动控制的算法,现在主要通过强化学习去做。
这是我们自研全尺寸高爆发双足人形机器人本体硬件,它有相应的数据,它有比较高的力量和速度,关键扭矩达到 400 扭米,这跟小米 SU7 车的扭距差不多,高度 1 米 7,六七十公斤的重量,这样它的自由度也是比较高的,载荷、速度和工作空间都是比较大的,因为我们设计出来希望它能通用,现实物理直接干更多样的活。达到这样状态的话我们国内率先去发展整治区关键路线,现在人形机器人可以跑的非常快、跳的很高,都是用了新型整治区关键路线,我们第 一代发布了产品,我们 CES 被黄仁勋选为全球十四强人形机器人之一。
在运动控制我们也做了很多工作,其中一个代表是 2024 年 RSS 最 佳论文提名奖,这是机器人最顶 级的会议,也是历史上首次中 国 第 一作者单位去获奖。这做了全球首 个双足人形机器人的复杂地形泛化行走,2023 年底做到让机器人在雪地行走、上下楼梯等,对应的开源框架已经有超过 2000 个 GitHubstar。
我们历史上打破了机器人跑步、跳高、跳远的世界纪录,是首 个雪地行走登上长城的机器人。这是我们在今年春节左右的时间发布的 demo,是全尺寸人形机器人做舞剑的动作,全身协调,能够比较柔顺并且能够做出高动态复杂动作。这是全尺寸人形机器人,我们没有针对跳舞、舞蹈做任何轻量化的设计,它具备很高的载荷、很长的臂展,直接有双手的五指灵巧手,因为我们的初衷是做通用机器人,我们仍然可以让它做出比较优美和复杂的舞蹈动作,因为它的尺寸比较大所以惯性也比较大,来回去翻滚的话难度也是比较高的。
接下来想说一下五指灵巧手,五指灵巧手它是末端执行器的更新,以往在工业领域主要是用夹抓或者吸盘它只有一个自由度,只能把物品夹起来再放到另一个地方,很难把物品位置翻转一下或者是做手类操作,这是不具备的,五指灵巧手可以像人一样做非常复杂的操作。另一个非常重要的点,现在的数据都是从人类行为数据来,用五指灵巧手能够更好的跟人类的行为去匹配上,所以我们能更好的把人类行为数据用上。
现在的灵巧手有三大技术派系,一个是连杆,一个是腱传驱动,一个是直驱,我们在全行业首创最早推出全直驱五指灵巧手的产品,2024 年推出了 XHAND 系列的灵巧手,现在在市面上比较受欢迎。直驱有比较多的好处和优势,最 大优势是响应速度非常快,手一秒钟能够点击 10 次鼠标,达到超人类的水准。因为有比较好的反驱能力,所以它的抗冲击能力是比较强的,同时它的稳定性也很高,同时它可以做到单手 24 千克的负载。
把软件硬件做好以后最终到商业化场景里面去落地,我们为什么同时要做软件硬件,我们希望打造完整的产品,最终提供完整的解决方案交互到终端里面。我们从物流工业开始逐步往服务和 ToC 包括家用去渗透。另一条线是在这个过程中,我们把硬件平台包括有一些软件的工具链、开放 API 出来,供二次开发者或者是研究者去使用,或者进一步去拓展。
我们认为从今年开始,具身行业已经开始进入商业化的拐点,以我们自己为例,我们的 B 端客户已经涵盖了十余个城市,在各种物流和工业相应的场景,正在进行常态化的运作,不仅仅是拍一个 demo 了。
同时,上面是标杆性代表客户的群体,现在各行各业对机器人这块非常重要的关注,机器人就像 AI 大模型一样,因为通用机器人是一个通用的东西,AI 大模型可以跟各行各业结合,通用人形机器人和具身智能也可以跟各行各业去结合。可以看到从互联网的大厂到汽车的主机厂到 3C 电子公司到物流的公司等等,都对此有非常多的需求。
这是我们的一些应用案例,是在物流分拣相应的场景。B 馆展区里有搭一个台子做相应的展示,但在现场做的时候还要更复杂一些。
同时,刚才提到开发硬件本体,开放一定的 API,开放一定软件工具链还有很多用户,基于工具链搭建他们自己的应用或者做新型的研究,这里有许多生态用户和相应的成果。
总结一下,刚才用到具体物流的场景,我们直接用的是端到端的具身大模型 + 人形机器人和灵巧手,我们相当于用通用的形态逐步去做具体专用的场景。这样的目的是希望通用形态能够持续迭代,到下一个场景的时候我们不需要重新建整个一套软硬件的系统,我们之前的场景所构建出来的能力和数据都可以做到比较好的复用。在此基础之上,随着系统能力的发展我们可以不断地开拓更新的场景,进化飞轮我们已经初步建立起来。
感谢大家的支持,这是我今天的分享,谢谢!
文章来源:投资界原文地址:https://news.pedaily.cn/202608/567962.shtml


登录后才可以发布评论哦
打开小程序可以发布评论哦