猎云网 11小时前
机器人一夜觉醒,谷歌最强大脑Gemini Robotics 2上线了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者|王磊

编辑|秦章勇

一夜之间,谷歌让机器人抢人类饭碗又进了一步。

就在今天凌晨,Google DeepMind 正式发布了其最新一代机器人模型 Gemini Robotics 2,并且配上多个了展示 Demo 视频。

一经发布便引爆整个机器人圈。

因为在 Gemini Robotics 2 的加持下,谷歌让机器人,学会了自己收拾房间,走路、下蹲、抓取、操作物体等,甚至,它还能叫上另一个机器人,两个 " 人 " 分工干活。

这意味着,机器人不再只是执行固定指令,而是真正理解世界、思考问题,并自主完成复杂任务,虽然行动还显得稍有笨拙,但不再是展示,而是实操。

过去人们一直期待机器人能走进我们的世界搭把手,如今真的照进现实了。

跟人抢活干

可能大家会疑惑,这样的事情印象中似乎不是早就实现了吗?

其实一直以来,人们对于人形机器人有个很理所当然的误解,会走路、会跳舞、会端物体,就等于会工作。

但事实上,人形机器人最难的动作,不是单纯把东西拿起来,而是拿东西之前,先让它自己稳稳的走到物体的面前,能否看清目标、甚至拿错后能否发现。

就像在谷歌公布的 Demo 视频中,当旁边的工作人员下达 " 把洒水器放进底层架子的绿色收纳箱里 " 这一指令后,Apptronik 的 Apollo 2 走到桌边拿起浇水壶,再走到货架前,把它放进底层的绿色箱子。

虽然这段演示看起来并不惊艳。走路、抓取、放置,单独拿出来都不是新能力。

但关键的是,谷歌做到了让机器人要把这些动作连起来:理解目标、找到目标、规划路线、控制双腿、走到目标面前、调整身体姿态,再让手臂和手指完成抓取,中间任何一步失败,后面的动作都无法继续。

甚至,在机器人实操从地上拿起篮子的的过程中,工作人员故意将篮子拉到另一边,Apollo 2 并没有停止工作,反而寻找起篮子并继续执行指令。

这看上去只是一次简单的收纳任务,但背后涉及的其实是一整套连续的全身移动与操作,而 16 个月之前,初代的 Gemini Robotics 还只是局限在控制机器人的上半身,完成桌面抓取等任务,而现在的 Gemini Robotics 2 已经控制范围扩展到从双脚到手指。

换句话说,Gemini Robotics 2,不只是让机器人拥有了一双更灵巧的手,而是开始尝试把腿、腰、手臂和手指连成一个整体。

这就意味着,不同于传统机器人只能按照预设程序工作,Gemini Robotics 具备更强的泛化能力——面对陌生场景,它可以理解目标、规划步骤,并根据环境变化调整行动。

比如看到桌上有杯子,它知道杯子应该放回杯架;看到地上有衣服,它知道衣服应该放进洗衣篮。这不是预设的规则,而是模型自己推理出来的。

除了全身移动操作,官方展示的另外几个操作 Demo 也都相当惊艳。

比如灵巧手的精细操作更进一步,之前那些模型控制机械手,顶多抓个球,拿个水杯这回谷歌直接让机器人用机械手打结,你没听错,像人一样给塑料袋打结。

还能把葡萄装进自封袋,再捏住袋口两端,把自封条慢慢收口。

也能拆拧灯泡,把在灯罩里的灯泡,慢慢拆下来,再拧回去,还没把灯泡捏碎,就很离谱了。因为相比于拆,拧上去更难,得先把灯泡轴线和灯座螺纹对上,旋进去还要维持同轴,力大了滑丝、力小了空转,最后还得判断什么时候算到位。

也正因如此,根据 DeepMind 同步发布的实操成功率,拆灯泡成功率达到了 92%,而拧上灯泡只有 36% 的成功率。

无论是哪一种操作,对于一个机器人来说无疑于噩梦,要做到受力反馈微妙到极点的程度,手指劲大一点小一点全废。

虽说离人类那种行云流水还差着火候,但至少证明这套模型对不同类型的手,适应能力和控制精度都上了个大台阶。

另外,还能做到双手协同,一只手拿着簸箕,另一只手拿着刷子,把桌面上的垃圾扫进去,还头一回让不同机器人之间互相通信打配合,不同类型的机器人可以相互传递任务信息、分工完成同一套工作流,从而处理那些单台机器人难以独立完成的复杂任务。

还有值得一提是,过去,机器人往往需要针对特定硬件进行大量编程。一台机械臂、一台人形机器人、一个移动机器人,都需要独立开发控制系统。

而 Gemini Robotics 2 希望改变这一模式,让 AI 模型成为机器人的通用智能层,按照 Google DeepMind 的表述:" 一颗大脑,适配所有机器人。"

谷歌表示,这一模型仅需数小时,并在不足 200 条示例数据情况下,就能完成对全新双臂机器人平台的适配。对于外形、传感器、自由度差异大的机器人硬件,同样能够快速适配。

而且给出了一部分的适配名单,包括 Apollo(Apptronik 的人形)、Franka、Dexmate、SO101、Trossen,都可以使用同一个大脑。

三大模型合作

那么谷歌是如何做到这些的?

虽然谷歌在发布时,将其称之为 Gemini Robotics 2 大模型,但实际上,背后有三个大模型的加持,对应着三层分工,补齐了机器人的操作、思考、适配三大核心逻辑。

第一个就是 Gemini Robotics 2,即传统的 VLA,视觉 - 语言 - 动作大模型,这个大家就比较熟悉了,捕捉周围环境,听懂人类指令,然后把它们直接转化成机器人的身体动作。

只不过,他现在控制的范围从上半身进化到了全身,也支持双臂机器人;在灵巧手和夹爪上都能做精细操作,是干活的主体。

但是,在现实环境中不会把所有东西都整齐地摆在机器人面前再操作,所以也就有了第二个模型的加持—— Gemini Robotics ER 2,具身推理模型。

Google 管他叫机器人的 high-level brain(高级大脑),简单来说,如果 Gemini Robotics 2 负责 " 怎么动 ",那么 ER 2 负责的就是 " 接下来做什么 "。

它不直接动电机,只是负责听懂指令、理解环境,然后将持续数分钟、涉及数百次决策的长序列复杂任务拆成多个步骤,然后把具体的动作执行派给下面任意一个 VLA 再逐步执行,并持续跟踪任务进度。

这也让当研究人员下达模糊指令 " 儿童需要进行运动 " 时,Apollo 2 就会自动解析已设置的日程任务,完成棒球与匹克球运动工具的搜寻与放置。

其还能识别关键事件节点,某一步失败了能自我纠正,能泛化到没见过的新情况,不至于出现一次失败就直接停机的情况发生,不同机器人之间能相互协作也是得益于这一模型的存在。

最后是负责端侧部署的 Gemini Robotics On-Device 2。也是谷歌目前效率最高的端侧模型,直接运行在机器人自带的计算设备上,不必每次都把信息发到云端。这样既能减少延迟,也能让机器人在断网或不适合上传数据的环境里继续行动。

它还有着多硬件载体兼容的特性,这也让其成为适配不同机器人主体的基础底座。

整体来看,谷歌这次发布的三款模型关系相当明确,类似于 " 动作员 + 调度员 + 本地反射弧 " 的组合,把机器人需要的几种能力拼到一起。

尽管从谷歌给出的说明来看,目前整体的动作均衡性表现较差,但趋势已经非常清晰了。

就像 iPhone 刚发布的时候,大多数人觉得 " 触屏手机有什么用 "。如今,智能手机重塑了所有人的生活方式。

而今天的机器人,已经站在了类似的节点上。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 谷歌 实操 apollo 王磊
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论