当机器人开始理解世界,通用智能才进入物理空间。
作者丨吴思梦 陈嘉欣
编辑丨岑 峰
过去几年,机器人解决的问题是 " 如何更精准地执行动作 "。
在工业生产线上,机器人可以完成焊接、搬运、装配等大量重复任务,但这些能力建立在一个前提之上:环境、流程和目标都已经被提前定义。机器人并不需要真正理解世界,只需要按照预设路径完成任务。
但当机器人开始走出工厂,进入物流、服务甚至家庭场景,问题正在发生变化。面对一个没有见过的物体、一个没有训练过的任务,机器人能不能理解环境、预测变化,并找到完成任务的方法?
这成为通用机器人走向下一阶段必须回答的问题。
大模型的发展为机器人提供了新的可能。语言模型证明,人工智能可以通过大规模数据学习复杂规律,并获得跨任务泛化能力。但机器人面对的并不是语言世界,而是真实的物理世界。
因此,具身智能领域正在探索一个更底层的问题:大模型究竟应该如何赋能机器人?
目前行业的主流方向是 VLA。它让机器人通过学习大量人类行为数据,将视觉、语言和动作统一起来。但 VLA 的核心仍然是模仿——模型学习人类过去如何行动。
问题在于,如果机器人面对一个从未见过的新任务,仅依靠已有动作经验,是否能够真正泛化?
另一条更激进的路线,是让机器人拥有世界模型。它不只是学习 " 应该做什么动作 ",而是尝试理解物理世界运行的规律,并预测未来可能发生什么。
在 WRC 2026 大会上,星动纪元创始人、CEO 陈建宇提出了自己的判断:世界模型可能不仅是 VLA 的增强模块,而可能成为下一代具身智能的核心范式。他更强调机器人作为物理智能体的特殊性。模型的进化并不只依赖数据规模,还需要通过本体进入真实世界,在真实交互中获得反馈。大脑、本体和场景并不是三个独立环节,而是在持续循环中共同演化。
以下为陈建宇演讲内容精编,雷峰网 · AI 科技评论在不改变原意的基础上进行编辑和整理。
01
通用机器人的两个特征,与协同进化的飞轮
终端之后的下一代智能终端产品,很可能是以某种家用机器人的形式存在的。这里最关键的一点,是能不能打造出更加通用的机器人。
我认为,这样的机器人必须具备两个特征。第一个特征是上限更高:拥有更高的自由度、更高的智能,能够做到许多以前的机器人做不到的事情,从而把整个市场打开。第二个特征是更加通用、泛化性更强:当我们去做一件新的事情时,不再像以前的专用机器那样需要重新开发硬件和软件,绝大部分能力都可以直接复用与泛化。
要打造这样一个通用机器,避不开两件事:同时做它的 " 大脑 " 和它的 " 本体 "。围绕这个目标,我们这几年已经实现了通用机器人软硬一体、全栈自研的多项突破。在大脑侧,自研了支撑端到端的大模型运动控制;在本体侧,自研了双足本体关节与灵巧手,并把它们很好地整合到了一起。
做这件事最重要的,是把大脑、本体和场景协同起来,形成一个协同进化的飞轮。飞轮的最上层,是我们的端侧具身大脑大模型,包括我们做的 VLA、世界模型与数据等,它是一个通用模型,能适配多种不同的本体、用到不同的场景中。中间层是本体:具身大脑最终要产生价值,必须放在某个本体之上,才能与物理世界交互、真正去干活。
最终,我们把大脑与本体一起应用到各类场景里,只要大脑足够通用、本体足够通用,它们就能比较通用地进入各个场景。而在场景应用的过程中,我们会不断获得大量数据反馈,这些反馈又反过来反哺模型的发展。就这样,我们把技术和商业化很好地协同起来,形成协同进化的飞轮。下面,我具体讲讲我们的思路和做法。
02
大脑:从端到端 VLA 到世界动作模型
先从具身大脑层面讲起。我把到目前为止的具身大模型迭代,归纳为三个范式。
第一范式:语言模型 + 机器人控制。这一切都始于 ChatGPT 大模型的出现。最初我们探索的是把语言大模型用在机器人里,但整体框架仍是传统的模块化机器人思路:用语言模型增强上层的推理,下层仍然是传统的感知、控制、执行模块。这一阶段,我们做出了全球首个大语言模型结合人形机器人的学术工作——以语言模型作为上层规划,下层感知控制执行仍由传统方法完成。
但我们很快意识到这种分层方法的局限:感知、规划、控制、执行都被模块化,模块间的特征和接口靠人工定义,无法端到端训练。语言模型和视觉模型都经历过从 " 模块化、人工定义特征 " 到 " 端到端、靠数据 scaling" 并最终成功的转变,我们相信,具身智能也应遵循类似的范式。
第二范式:多模态底座上的 VLA 模型。大约在 2023 年,以 GPT-4 为代表的多模态语言模型出现,把视觉等信息融了进来。对应到具身模型,就产生了 VLA:在多模态模型的底座之上,把机器人非常重要的动作和与环境交互的功能,也融合进同一个统一模型。今天典型的 VLA 模型,比如 Google 的 PaLM 系列、RT 系列等,已经形成统一范式:以多模态语言模型为底座,再加上一个动作头,端到端训练。这一范式,我们其实是历史上最早公开成论文发表的团队之一,2024 年就发表了相关工作。
第三范式:世界模型。在 AI 大模型一侧,最早的代表是 2024 年发表的 Sora 第一代,如今 Seedance 等也发展得非常迅速。具身智能基于类似的方法,做出了我们所说的 " 世界动作模型 ",它除了能预测未来的动作,还能预测未来世界状态的演化,从而形成一个闭环。
那么,为什么我认为还需要做世界模型?VLA 的局限,不在端到端训练本身,而在它的学习方式上。VLA 几乎所有的学习都靠 " 模仿 ":所以要采集大量人类行为数据,通过模仿形成泛化。但这种泛化相对有限——遇到一个新场景、新任务,如果没有被模仿过,它很难举一反三地泛化过去。世界模型则不同:它要构建的是对物理世界的常识性理解,这种理解天然具备较好的泛化性,比如一个水杯,你往下倒水,水就会往下流,这类常识不需要一遍一遍地学。这正是我们认为世界模型能大幅提升泛化性的原因。
从功能上看,我们的世界动作模型涵盖了 VLA 的全部功能:左边输入,上面是代表 " 视觉 " 的感知输入,下面是代表 " 语言 " 的 prompt;右边上面是 " 动作 " 输出,它同样要产生动作。而世界模型还多出一块:能够对物理世界的未来演化进行预测。
两者更大的区别,在于智能底座:VLA 的底座是多模态语言模型,最底层的智能内核是语言,优势是抽象思维强、泛化广,缺点则可能缺失一些细节的物理信息与理解;而如今的世界模型多以视频模型为主,直接处理原始的图像、视频、音频数据,这些数据里包含了更丰富的物理世界细节,视频模型能直接处理它们。所以我认为,视频底座的世界模型,更适合我们这种面向物理世界操作的具身模型。
沿着这条思路,我们做出一系列工作。早在 2024 年,我们就发表了世界动作模型的工作——这是全球首个融合视频预测与动作预测的世界动作模型,如今也基本成为世界动作模型的标准范式,比英伟达的类似方案早了约一年。在数据层面,世界模型对数据的吸收能力比较强:我们构建了基于大规模人类行为的数据集,2025 年初发表论文将其与世界动作模型结合,数据集中不仅加入机器人真机数据,还把第一人称的人类操作数据也一起用于训练。此外,我们还与 Facebook AI(FAIR)团队的 Andreas 合作完成了 ControlNet 相关工作,进一步提升了动作行为的精准可控性;并把世界模型放到真实世界中,用真实反馈进行迭代与强化学习。
具体方法不再赘述,我展示一下我们模型的能力。
第一,世界模型的建模与预测能力。我给大家看了两幅图:一幅是世界模型生成的,一幅是真实世界实拍的——几乎分辨不出来。这说明通过大量数据和较好的网络设计,世界模型已经能精准预测复杂的物理现象。类似的例子还有很多:毛巾的褶皱、把一张抽纸抽出来,这些细微操作都能被很好地建模,这对精细操作非常有利。
第二,零样本任务泛化。这是我们关于 " 泛化 " 的终极追求——任务级泛化:完全没有学过类似任务,模型也能完成。现在的 VLA 模型能较好实现 " 物品泛化 "(换个物品或位置可能仍能泛化),但 " 新任务泛化 " 很难。我们希望模型面对没见过、没训过、没有数据的任务也能做到。零样本的意思,就是把预训练模型直接接到新任务上,看它能否泛化过去。
我们在自己办公区随机取景、随机下达指令,得到了比较好的初步结果:场景背景复杂多样,指令还带有一定逻辑推理——比如 " 把左边的拖鞋放到右边拖鞋的旁边 "" 把第二个水杯拿起来 "" 从一堆杂物中把胶带拿起来,并把它从水平方向放到垂直 "。模型能够端到端地把这些行为动作直接预测出来。
第三,精细操作与跨本体能力。经过大量后训练,模型可以完成比较精细的操作:叠纸盒、翻袜子(把袜子从里到外翻出来)、脱鞋、开水,都能做得比较好。它还具备跨本体的能力,能够操作复杂的灵巧手,进而使用工具,比如用螺钉枪打螺钉,用移液器时不仅拿起来、移动到对应位置,还会用大拇指按下按钮再操作。我们也因此获得了一些国际榜单的奖项。
03
本体:全栈自研的双足与灵巧手
有了一个能够理解世界的大脑,还需要一具与之匹配的身体。
对于通用人形机器人来说,灵巧手、双足以及全身高自由度运动控制,都是过去没有成熟答案的方向。传统机械臂解决的是固定场景下的重复动作,而人形机器人需要进入开放环境,面对更多未知任务。因此,我们选择从整机、关节模组、机械手,到电机、减速器、驱动器进行全栈自研,同时开发对应的运动控制算法。
我们设计这套本体的目标,并不是让机器人完成某一个动作,而是让它具备进入真实物理世界、承担更多样任务的能力。全尺寸双足机器人需要同时兼顾力量、速度、自由度和工作空间,这也是为什么人形机器人的硬件路线正在从传统机械设计,走向更高自由度的整机学习和控制路线。
在运动控制层面,我们做了全球首个面向商用的人形机器人复杂地形方案,2023 年底已实现涉水行走、上下楼梯等能力,今年春节期间,我们还发布了全尺寸人形机器人舞剑的演示,因为我们的公司做的是通用机器,我们仍能让它做出非常优美的舞蹈动作,它的尺寸比较大、惯性也比较大,来回翻转的难度其实很高。
再看灵巧手。灵巧手是我们末端执行器的重要类型。以往工业里主要用夹爪和吸盘,只有一个自由度,只能把物体夹起来放到另一个地方,很难做翻转、手内操作等复杂动作;而灵巧手可以像人的手一样做非常复杂的操作。另一个重要的点在于:现在我们的数据都来自人类行为数据,灵巧手能更好地与人类行为匹配,从而把人类行为数据用得更充分。
目前灵巧手主要有三大技术派系:连杆驱动、腱绳驱动与直驱。我们在全行业最早推出全直驱的灵巧手产品,直驱的好处很多,最大的一个是响应速度极快:我们的手一秒钟能点击 10 次鼠标,达到超人类的水准;因为有较好的反驱能力,抗冲击能力也强,稳定性好;同时我们把它做到了 24 千克的负载。
04
商业化与结语:飞轮转起来之后
把软件和硬件都做好、阶段化以后,最终最重要的,是把它真正落到商业化场景里去。我们始终坚持同时做软件和硬件,就是为了打造完整的产品,最终提供完整的解决方案交付给终端用户。我们从物流工业起步,逐步向服务、C 端和家用渗透。另一条线是:把硬件平台、软件工具链与 API 开放出来,供二次开发者或研究者使用、拓展。
我认为,从今年开始,具身行业已经进入商业化的拐点。以我们为例,B 端客户项目已经覆盖十余个城市,在各类物流工业场景中常态化运作。不仅仅是拍一个 demo。各行各业对机器人也非常关注:机器人就像 AI 大模型一样,是一个通用的东西,可以与各行各业结合。
从互联网大厂,到汽车主机厂,到 3C 电子公司,到物流公司,都有非常多的需求。我们在物流分拣等场景已有实际应用案例;同时,基于我们开放的硬件本体、API 和软件工具链,很多用户搭建了自己的应用,或开展新型研究,形成了比较丰富的生态成果。
最后总结一下。大家可以看到,即便在物流这样的具体场景,我们用的也是 " 端到端大模型 + 人形机器人 + 灵巧手 " 这一通用形态,再用它逐步去做具体的专用场景。这样做,是希望通用形态能够持续迭代:进入下一个场景时,我们不需要重新搭建一整套系统,之前场景构建出的能力和数据都可以较好地复用。在此基础上,随着整个系统能力的发展,我们不断开拓更新的场景,这样的规划飞轮,我们已经初步建立起来。
通用机器人不是一个单点产品,而是一个持续进化的系统。大脑更聪明,本体更强大,场景更广阔,飞轮就会转得越来越快。感谢大家,这是我今天的分享。
WRC 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了WRC2026 参会群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 workshop、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门:扫码进群或添加微信 Qvv0909777,备注:WRC+ 单位 / 学校 + 姓名 + 方向。
搞科研 / 搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈


登录后才可以发布评论哦
打开小程序可以发布评论哦