
Alphabet 旗下人工智能研究实验室 Google DeepMind 今日正式发布 Gemini Robotics 2 系列模型,该系列专为驱动人形机器人优化,旨在实现多台自主机器协同完成复杂任务。据官方介绍,新模型可自动化处理包含数百个步骤的家务劳动。
突破 " 双系统 " 架构局限
现有人形机器人多采用 " 双系统 "AI 架构:由具身推理算法制定高级计划,再交由视觉 - 语言 - 动作(VLA)模型转化为电机底层命令。Gemini Robotics 2 系列的核心亮点在于其具身推理模型—— Gemini Robotics ER 2。
ER 2 支持用户通过自然语言下达指令,能够规划并执行耗时数分钟、包含数百个步骤的长程任务。该模型具备工具调用能力,可访问外部云服务(如 Google 搜索)以澄清模糊指令。此外,ER 2 能将冗长任务拆解并分配给多个机器人并行处理,从而显著提升执行效率。
针对任务执行中的容错需求,ER 2 引入两项关键功能:一是基于摄像头画面的进度跟踪,若执行出错,模型可识别最后正确步骤并从断点继续,无需从头重来;二是更精准的任务完成判定,帮助机器人更快进入下一环节,优化纠错流程。
Google 工程师 Steven Hansen 和 Peng Xu 在官方博客中表示:" 通过观看连续视频流,机器人现在可以跟踪进度、实时调整,并确切知晓何时进入下一步。"
两款 VLA 模型协同作业
在 ER 2 生成执行计划后,指令将被发送至系列中的两款 VLA 模型之一,由其转化为机器人的底层控制信号。
首款模型为 Gemini Robotics 2。与早期版本仅控制手部不同,新模型可操控人形机器人的全身组件,通过优化重心最大限度降低跌倒风险,并支持更广泛的机械手类型。
第二款模型为 Gemini Robotics On-Device 2,专为在人形机器人机载计算机上直接运行而设计。DeepMind 表示,该模型仅需数小时训练即可适配新型人形机器人硬件。
开发者访问与安全基准
目前,开发者可通过 Google Cloud、Gemini API 和 Google AI Studio 访问 ER 2 模型。伴随模型发布,DeepMind 同步推出了名为 ASIMOV-Agentic Benchmark 的新具身 AI 安全基准,用于评估人形机器人在避免碰撞及其他潜在风险方面的能力。
【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】


