相信去年来过 WRC 现场的朋友,多半会跟我一样:
刚一踏进场馆,就开启了逛展隐藏支线——寻找遥控器。
那时候,几乎是每一个成功操作的机器人,背后都有一个拿着遥控器的小哥。
就算绕着展台兜了一圈,没找到人,很快也会发现,机器人来来回回演示的,多半还是提前编好的一套 " 公式动作 "。
说到底,机器人虽然在动,但真正干活的,很多时候还是人。
但今年的 WRC,体感上已经明显不一样了。
各家展台上,自主干活几乎成了标配,后面拿着遥控器的人明显少了,就算偶尔还能看到遥操作,多半也是在采数据。
老实说,虽然目前机器人自主干活仍然不甚丝滑,而且难免会看到抖动、抽搐、失败,但起码,这活真是机器人自己干的,实乃一大进步。
不过逛了一圈之后,我们又发现,事情显然还没结束。因为机器人自己把活干起来,只能证明它有了 " 自主性 "。
真要进工厂、仓库、商超,变成生产力,后面还有更现实的一道考题:
换个东西还能不能干?干得够不够准?速度能不能跟上?
也就是——泛化、精度和效率。
而今年把这三件事摆得最直白的展台之一,恰好也是整个 WRC 最大的展台:
星海图。
500 平方米,10 组 Demo,一排机器人同时开工。从前置仓、工业装配、礼盒折叠,到双足、轮式新品,几乎把机器人真正进入生产现场之后会碰到的几类问题,都搬到了一个展台上。
所以,看到星海图的巨大展台后,我们真正好奇的,也不只是:
为什么一向低调的星海图,这次突然搞了个全场最大展台?
还有,当整个行业都开始强调 " 自主干活 " 之后,星海图又想把具身智能往前推到哪一步?
走,进去看看!!
生产力觉醒,究竟是怎么个觉醒法
走进展台,我们看到星海图这次 WRC 的主题,叫生产力觉醒。
为了一探究竟怎么个觉醒法,我们也现场试了一下。
首先是现场围观人数最多的,星海图和京东合作的前置仓。
在排了一会儿队之后,我们直接在 iPad 上下单了两瓶脉动。
机器人接单后,会自己排队、找货、取货,再一路送到柜台。
有一说一,在第一次尝试把脉动放到柜台时,机器人失败了;
就在我们以为是瓶子太重、太粗不好夹的时候,机器人调整了几次动作,最后还是成功放了上去。
拿回来之后,剩下的一切都变得相当丝滑,打包,拉袋,封口,一气呵成~
整体看下来,这套前置仓已经基本复刻了一套真实的生产流程。
货架没有为了方便机器人抓取而刻意摆开,从下单、抓取,到移动、打包、交付,整套流程都由机器人端到端完成。
机器人在这里既需要完成长程规划,移动操作," 下蹲抓取 ",也涉及到对不同 SKU、塑料袋这类刚性和柔性物体的交互。
更关键的是,它并不是只会抓我们眼前这两瓶脉动。
据现场工作人员介绍,这套系统背后的 G0.5 模型,已经能够泛化到上万种 SKU。
这其实对应的,就是机器人进入真实世界之后的第一道生产力门槛:泛化。
如果换个商品、换个摆法就得重新训练,那再自主,本质上也还是一套更复杂的专机。
值得一提的是,打包机器人的加入,也把整个闭环进一步串了起来。
我们从下单到拿到商品,大概等了 3-4 分钟,速度已经在可接受的范围内。
再往里走,是一套机器人组装机器人的工业装配场景。
虽然听起来多少有点 " 物理 RSI" 那味儿,但这里真正考验的,其实是精度。
毕竟工业装配不像抓瓶子,零件差一点可能就装不上。
为此,星海图在基础模型之上引入强化学习,将操作精度做到1mm 以内、成功率 99.9%,同时把工作效率提升了400%。
也就是说,到了真正的工业现场,自主只是前提,精度和良率才决定它能不能上产线。
再往下,是一个看起来没那么唬人、实际却挺难搞的任务:折礼盒。
我们现场随手丢给它一个纸盒,机器人拿到之后,大概 1 分钟就能折完。
这里的难点在于,纸板和刚性零件不一样:折过去会回弹,状态一变,后面的动作也得跟着变。
以前很多靠背一套 " 小连招 " 的机器人,到这基本就歇了:中间一步被打断,直接宕机。
但 G0.5 可以根据纸盒的实时状态调整动作,我们在现场站了一会,成功率已经没的说了。
不光是纸盒,对于叠衣服这种柔性操作,G0.5 也可以轻松拿捏。
除了这些依靠具身大脑的任务以外,星海图这次还带来了最新的通用小脑成果——
双足机器人 Kengo。
它遇到没见过的地形时,不需要重新训练,就能边感知、边调整步态。
这其实有点呼应了最近全身智能的研究热点。
毕竟,以后机器人真进了家庭、工厂和仓库,能不能走过没见过的路,本身也是泛化的一部分。
值得一提的是,这也不是星海图首次发力机器人运控。
早在 2023 年,联合创始人赵行团队的 Robot Parkour Learning,就曾入选 CoRL 2023 Oral,并跻身最佳系统论文候选 Top 3;此后,他们又将这一路线推进到双足人形机器人。
当然,500 平米的展台上远不止这些。
抓包裹、物料分拣、折衣服、长程送件……机器人干的活五花八门,囿于篇幅,就不一一展开了。
但把前面这些 Demo 串起来看,星海图这次真正想展示的东西,其实已经很清楚了:
机器人 " 能自主干活 ",只是生产力觉醒的起点。
再往下,至少还有三道更现实的考题。
第一是泛化。换个 SKU、换个物体、换个环境,甚至中间状态发生变化,机器人还能不能继续干,而不是重新训练一套模型。
第二是精度。如果只是在 Demo 里把动作做个大概,到了工厂里精度不够、良率不行,那依然干不了真正的活。
再往前一步,就是效率。毕竟真正到了生产现场,机器人最后要比的,不是 Demo 漂不漂亮,而是能不能在相同时间里完成一样的工作,甚至把这笔账算得比人更划算。
所以一圈看下来,星海图这次至少做了一件挺有意思的事:
当整个行业开始从 " 遥操作 " 走向 " 自主干活 ",它又把考卷往前翻了一页——把泛化、精度和效率,同时摆到了台面上。
从 " 机器人能不能自己干 ",变成了:机器人能不能快、准、泛化地把活干下来。
而这,可能才是真正的 " 生产力觉醒 "。
那么,这背后究竟是怎么做到的?
十几组 demo 背后的具身大脑
在前面的展示里,机器人之所以能做到百万 SKU 的物品与刚性柔性物体泛化,并把一整套长程任务自己串起来,背后用到的就是星海图最新的 VLA 模型G0.5。
在公开榜单测试中,G0.5 已经在 LIBERO、BEHAVIOR-1K、RoboTwin 2.0、DROID Zero-shot 等 8 个权威 Benchmark 中登顶,覆盖长程任务、精细操作、零样本泛化等不同能力,整体位居第一梯队。
在具体的架构方面,G0.5 走的是一条统一自回归路线,用 G0.5 背后研究者的话说就是,你可以把它理解成一个大语言模型:
它把视觉理解、具身推理和动作生成,都放进了同一个 Transformer Decoder 里。
和不少 "VLM 负责看和想,Action Expert 负责动 " 的 VLA 架构不同。G0.5 更像是把 " 想 " 和 " 做 " 重新接在了一起:机器人一边理解环境、一边判断下一步该干什么,然后继续往下生成动作。
这样做的第一个好处,就是过去几年 LLM 已经学出来的理解、推理和任务拆解能力,能更顺畅地接到机器人身上。
模型不用从头再学一遍 " 怎么想 ",而是直接把已经会的思考变成动作。
所以到了前置仓这种任务里,它面对的就不只是 " 抓一个东西 ",而是可以先理解订单,再把找货、规划、抓取、打包这一整串事情接着做下去。
而统一自回归的第二个好处,就是思考和动作可以连续往下走。
在前面的折礼盒 demo 中,这就让机器人能够一边执行,一边根据纸盒的变化及时调整动作。
而在 G0.5 代表的 VLA 路线之外,星海图还同时押了另一条路线:世界模型。
他们今年推出的Fast-WAM,最大的特点就是快。
针对以往世界模型推理过慢,难以实际部署的问题,Fast-WAM 把推理延迟压到了约 190ms,相比传统方案提升约 4 倍,发布时做到了全球最快。
目前,Fast-WAM 论文引用量已经位居世界模型领域第一,也得到了同为世界模型创业者谢赛宁的认可。
所以回过头看,星海图在 " 大脑 " 上的路线其实挺实用主义。
VLA 也做,世界模型也做,不是先选一个技术信仰,然后证明另外一条路线是错的。
而是反过来:哪个东西能让机器人把活干得更好,就先用哪个。如果都好,那就都用。
前面 500 平方米里看到的那些 Demo,某种程度上就是这套思路的集中展示。
但说到底,模型架构只是第一步,真正能在具身领域拉开身位的,还得是数据以及全栈自研带来的飞轮效应。
数据、本体、模型闭环
星海图创始人、CEO 高继扬曾不止一次解释过这套飞轮:
做过自动驾驶你发现:要做物理世界智能,就得有物理世界数据;要有数据,就得有一个收集数据的载体,整机。以前做自动驾驶最大的问题就是软件供应商拿数据的链路不通畅,飞轮跑不起来,这就是致命的问题。
说白了,不掌握本体,就很难掌握数据闭环;数据闭环跑不起来,大脑也就很难持续迭代。
所以在数据上,星海图一直押注真实数据。
早在去年 9 月,他们就开源了 GOD 真实场景数据集,下载量全球第一。与此同时,还通过投资简智、元流等玩家继续扩充数据来源,并计划 2026 年将真实数据规模做到100 万小时。
而这些数据背后,是星海图自己的本体体系。
包括最新的双足机器人 Kengo、轮式机器人 Nexo 在内,星海图已经先后推出 R1、R1 Lite、R1 Pro 等一系列机器人。
整机握在自己手里,带来的不只是数据来源更可控,模型、控制和硬件也能一起迭代。
据现场工作人员介绍,G0.5 这次表现背后,很大程度上就来自自研本体产生的高质量数据,以及模型和本体之间更高效的协同。
这也是具身智能和纯软件系统很不一样的地方:
机器人最终面对的是物理世界,模型能力、控制算法、执行器和本体设计彼此牵连,很难完全拆开优化。
模型发现新的能力边界,本体就能针对性迭代;本体升级之后,又能采集更高质量的数据,反过来继续训练模型。
于是,一套完整的飞轮也就跑了起来:
数据推动模型,模型定义本体,本体再生产新的数据。
上一代机器人出去干的每一份活,都有机会变成下一代继续进化的燃料。
具身智能,开始参加生产力大考
所以再回到开头那个问题:WRC 最大的展台,为什么是星海图?
看完整个展台,答案已经很明显:
星海图想展示的,不只是机器人又学会了多少新 Demo,而是当 " 自主干活 " 逐渐成为行业标配之后,具身智能的考卷已经开始往下一页翻。
过去,大家先解决的是机器人能不能脱离遥控器,自己把任务做起来。
而真到了工厂、仓库和真实客户现场,光 " 能自己干 " 显然还不够。
接下来要比的,是换个东西还能不能干,干得够不够准,速度又能不能跟上。
也就是泛化、精度和效率。
换句话说,机器人真正成为生产力,不只是要 " 会干活 ",而是要能在真实现场快、准、稳地把活干下来。
这次 500 平方米、十几组 Demo,从仓储拣选、工业装配,到柔性操作和双足运动,星海图某种程度上就是把这张新的考卷,集中摊在了大家面前。
而作为具身 " 大脑 " 第一梯队玩家,它所展示的也不只是自己的能力边界,更像是在给行业打一个样:
接下来,不再只比谁的 Demo 更好看,而是比谁能真正把机器人变成生产力。
从 " 能不能自主干 ",到 " 能不能快、准、泛化地干 "。
某种程度上,这可能才是具身智能下一阶段真正要卷的东西。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦