
谷歌 DeepMind 正式发布 Gemini Robotics 2,该系统通过融合视觉、语言及动作模型,赋予机器人更强大的物理智能。据悉,新模型已能操控包括人形机器人在内的多种设备,执行整理货架、系袋子和更换灯泡等复杂任务。谷歌 DeepMind 机器人业务负责人卡罗琳娜 · 帕拉达(Carolina Parada)称,这是迈向真正 " 物理 AGI" 的关键一步,旨在让机器人具备完成人类各类任务的能力。
多模型协同架构
Gemini Robotics 2 将多种 AI 模型整合为统一系统,通过协同工作实现环境理解与行动决策。其中,视觉语言模型(VLM)负责处理图像与视频信息,进行逻辑推理及人机交互;两个视觉语言动作(VLA)模型则专注于物理空间移动,精准控制机器人的全身运动及机械臂、手部操作。
在演示视频中,Apptronik 公司的 Apollo 2 机器人搭载 Sharpa 机械手,成功自主完成货架整理。值得注意的是,该模型目前仍依赖特定训练数据,包括人类远程操作记录、视频示例及模拟数据,尚不具备在无特定训练下广泛执行复杂任务的通用能力。
强化安全基准
针对安全性,谷歌采用了多层级防护策略,在每个模型层均部署了安全护栏。同时,公司推出了全新基准测试 ASIMOV-Agentic,用于评估 AI 系统在协作控制机器人时的安全表现,重点检测指令是否可能引发有害或不确定后果。
【星途科讯 图文丨伊贝 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦