
财联社 7 月 31 日讯(编辑 赵昊)谷歌 DeepMind 发布了一款全新的、面向机器人的人工智能模型,声称可使人形机器人能够协调全身动作。
这是谷歌将 Gemini 人工智能技术进一步拓展至机器人领域的最新举措,旨在让机器人具备推理能力、规划多步骤任务,并适应人类生活环境。
新系统名为 Gemini Robotics 2,能够让机器人在执行任务时完成行走、下蹲、操控物体等动作,并结合推理能力自主完成任务。
谷歌表示,与此前主要控制机器人上半身动作的模型不同,Gemini Robotics 2 可以实现对整个人形机器人的全身控制。
在一段预录演示中,DeepMind 的新模型操控 Apptronik 公司的人形机器人 Apollo 完成了一系列动作,包括穿过房间、拿起洒水壶并将其放到架子上,同时还能避开途中障碍物。

与此同时,DeepMind 还发布了另外两款机器人 AI 模型,它们既可以协同工作,也可以独立运行。
其中,Gemini Robotics 2 负责将摄像头画面和自然语言指令转换为机器人电机控制指令;而 Gemini Robotics ER 2 则充当机器人的 " 推理系统 ",负责规划多步骤任务,并协调多个机器人共同完成同一目标。
谷歌还展示了机器人灵巧性的提升。研究人员表示,在测试中,系统完成 " 拧下灯泡 " 这一任务的成功率达到 92%。不过,在扎垃圾袋、封好 Ziplock 密封袋等更加复杂的操作中,成功率仍然相对较低。

此外,谷歌还推出了一套新的机器人安全评测基准,用于测试机器人是否能够识别不确定情况,并拒绝执行存在安全风险的指令。
谷歌表示,相较此前的模型,Gemini Robotics ER 2 是公司迄今最安全的机器人模型,尤其在遵循指令以及避让人类方面表现更佳。
谷歌表示,Gemini Robotics ER 2 将通过公司的开发者平台 AI Studio 开放,并在企业级 AI 平台上提供私人预览;更加专业化的 Gemini Robotics 2 和 On-Device 2 模型则将率先向早期合作伙伴及 100 多家受信任测试机构开放。
公司还宣布,将向机器人开发者开放模型候补名单,并正与包括 Apptronik、Agile Robots SE 以及 Boston Dynamics 在内的一系列核心合作伙伴展开合作。

DeepMind 机器人业务副总裁 Carolina Parada 在介绍时表示:" 我们的目标是将 AI 带入物理世界,并构建一层能够被所有机器人使用的智能系统。"
但 DeepMind 机器人业务总监 Kanishka Rao 也坦言,真正实现机器人媲美人类的灵巧性仍然任重道远。目前机器人动作依然缓慢且谨慎,因为机器在执行过程中仍需停下来思考那些人类能够凭直觉完成的决策。
Rao 强调,机器人目前的学习效率仍远低于人类。人类往往只需经历一两次错误便能调整行为,而机器人距离这一水平仍有较大差距。
此次发布建立在谷歌于 2025 年推出 Gemini Robotics 的基础上,后者是 Gemini 旗舰 AI 模型的机器人版本,能够将语言和视觉信息转化为机器人的实际动作。
这一产品也标志着谷歌重新点燃了延续十余年的机器人战略。Alphabet 曾收购多家机器人初创公司,但随后逐步缩减相关业务,并于 2023 年关闭了 Everyday Robots 部门。
谷歌的竞争对手 OpenAI 和英伟达也在积极布局机器人 AI。OpenAI 一直探索融合视觉、语言和动作能力的通用机器人基础模型,而英伟达则提供帮助开发者训练 AI 机器人的软件平台。


登录后才可以发布评论哦
打开小程序可以发布评论哦