把大模型往机器人身上装 , 已经成了行业潮流 , 但 " 语言天才 " 接上真实身体到底行不行 , 一直缺一份系统实测。7 月 9 日 ,Anthropic ( Claude 背后的 AI 公司 ) 的前沿红队 ( Frontier Red Team, 专门给 AI" 挑刺 " 的团队 ) 发布了一份研究 , 把自家模型真的接上了机器人。
试验台有三种机器人 : 宇树 Go2 四足机器狗 ( 12 个关节 , 部署在真机上 ) 、宇树 G1 人形机器人 ( 29 个关节 , 在模拟环境里跑 ) 、Franka Panda 机械臂 ( 7 个关节 , 德国研究用机械臂 ) , 另外还有倒立摆这类经典控制关卡。
测试分四层接口 , 像四种不同的上岗方式 : 最底层是直接控制 ,AI 亲手拧每一个关节的力道 ; 往上一层是写代码 ,AI 编一段 Python 控制程序让机器自己跑 ; 再往上是指挥 ,AI 给预训练好的动作策略下命令 ; 最高层是当教练 ,AI 去训练一套自己的强化学习 ( 让机器自己反复试错练出来的 ) 策略。
最底层的结果是惨败。直接控制关节时 , 模型大多数时候都失败 :G1 人形机器人从瘫倒姿势站起来 , 成功率是零 ;Go2 机器狗靠直接控制保持平衡 , 最多撑 2 秒。

被测平台之一 : 宇树 Go2 四足机器狗 ,12 个关节 , 部署在真机上
机械臂上也一样。在 LIBERO ( 机械臂操作任务基准 ) 测试里 , 直接控制的完整任务成功率只有 0 到 5.5%。
可一换接口 , 立刻翻身。让 Claude 写控制代码 , 或者去指挥预训练的 VLA ( 视觉 - 语言 - 动作模型 ) , 表现明显改善 ,Opus 4.6 在 VLA 监督下的操作任务拿到了有意义的成功率。研究者一句话点破 : 模型的机器人成绩 , 既取决于模型本身 , 也同样取决于机器的身体和控制接口。
导航测试暴露了软肋。让模型找到 25 英尺 ( 约 7.6 米 ) 外的目标 , 它认得出目标 , 却常常提前 " 以为自己到了 "; 绕办公室一圈的导航任务 , 所有受测模型全军覆没。瓶颈不在 " 看 ", 而在 " 知道自己在哪 ": 空间自我定位和长程规划是最大短板。有意思的是 , 给模型配一个指南针式的方位工具 , 比给深度图、第三人称视角都更管用。
代际进步也很明显。Opus 4.6、4.7 和 Mythos Preview 在重试时调整策略的能力明显更强 ; 综合 " 具身得分 " 上 ,Mythos Preview 拿到 0.389 ( 满分 1 分 ) , 是受测模型里最高的 , 也是强化学习环节里少数能持续训练出有效策略的模型。
研究还有个耐人寻味的细节 : 模型主要依赖最近的上下文 , 把更早的交互记录删掉 , 对成绩影响很小 ; 给更多思考时间 , 对大多数任务的帮助也有限。换句话说 , 这不是 " 多想想 " 就能解决的问题。
这份报告给 " 大模型直接开机器人 " 的想象泼了盆冷水 , 也给行业主流路线背了书 : 高层交给大模型当 " 大脑 ", 底层交给专门控制器当 " 小脑 ", 分工协作在可见的将来仍是现实解。还值得一提的是 , 测试里的两台主角都来自中国的宇树科技——它们已经成了全球 AI 实验室的标准试验台。


登录后才可以发布评论哦
打开小程序可以发布评论哦