盖世具身智能获悉 近日,星尘智能(Astribot)团队发布了在线强化学习框架 SmoothRL,由王佳楠担任项目负责人。该框架首次将异步 online RL 放到真实高动态投掷任务中验证,让在线学习不只处理 " 最后几毫米 " 的精度问题,也进入连续加速、精确释放、不能停顿的动态操作,从而解决机器人在连续执行任务过程中,模型异步推理与真实执行动作不一致导致的在线学习复盘偏差问题。
为此,SmoothRL 把一段动作分成三部分:前面已经被上一轮动作占用的是 Committed Region,中间真正落到机器人身上的是 Execution Region,后面还没执行就被新计划替换的是 Discarded Region。策略更新只针对真正执行的中间这一段。
团队把这个原则叫做 Reinforce in Deployment:机器人真实工作是什么节奏,强化学习就按什么节奏学。
星尘智能团队在 Astribot S1 机器人上测试了动态投掷、给笔戴帽和开箱三项任务:
动态投掷:39% → 94%。机器人要把不同位置的物体投进不同位置的目标箱。除了判断方向,还要根据远近调整释放速度,而且整个摆臂过程不能突然停下来。在累计 250 个 rollout episodes 的评估节点,成功率从 39% 提升到 94%。
给笔戴帽:8% → 83%。双臂需要把笔和笔帽准确对齐,允许的相对位姿误差小于 5mm。基础策略往往已经到了目标附近,最后几毫米却经常对不上。
开箱:30% → 90%。机器人要把约 1mm 宽的刀片插进只有 2-3mm 宽的箱盖接缝。基础策略存在稳定的左偏,经常直接扎进纸板;在线学习后,最终成功率达到 90%。
在线强化学习后,机器人失败模式发生显著变化。开箱任务的失败样本中,刀片相对接缝的左右偏差缩小到 1 — 2mm;给笔戴帽的失败样本也主要变成正确位置附近的小幅错位。在真实自主投掷 rollout 中,在线 RL 后右侧末端执行器的加速度 RMS 降低 52%,jerk(加加速度)降低 47%
不过星尘智能表示,SmoothRL 当前还存在一定边界,模型推理时间需要控制在预设预算内,而且当前方法主要是在冻结基础策略附近做有限幅度的修正。如果基础策略本身离正确动作太远,轻量 RL 模块也很难凭空救回来。
但至少在这三个任务里,可以看到一个很直观的范式:基础模型先让机器人学会怎么做,真实世界里的后训练,再把最后几毫米一点点练准。


登录后才可以发布评论哦
打开小程序可以发布评论哦