盖世汽车 前天
上海期智研究院研发RL‑100学习框架 提升机器人抗环境扰动能力 实现100%任务成功率
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

盖世汽车讯 机器人正逐渐进入家庭、公共场所、办公室、工厂以及医疗保健等各类场景。然而,尽管机器人具有巨大潜力,许多现有机器人在动态且不可预测的真实环境中的表现,仍不及其在受控实验室环境中的测试效果。

据外媒报道,上海期智研究院(Shanghai Qi Zhi Institute)的研究人员近日开发出一种名为 RL-100 的新型人工智能(AI)学习方法,可帮助机器人更快掌握新技能,并在不断变化的环境中稳定完成任务。该团队在发表于期刊《Science Robotics》的一篇论文中介绍了这一框架。RL-100 融合了两种 AI 训练方法——模仿学习(imitation learning)和强化学习(reinforcement learning)。

论文第一作者 Kun Lei 在接受 Tech Xplore 采访时表示:" 这一项目源于我们反复观察到的一个差距:机器人能够成功演示某项任务,并不意味着它能够在真实世界中稳定可靠地完成这项任务。"

Kun Lei 称:" 模仿学习通过让机器人学习人类示范,为其提供了良好的起点,但有限的示范数据无法覆盖所有失败情况、外部扰动或意外场景。一个机器人即便 10 次中成功 9 次,在实验室里看起来已经相当出色,但对于许多真实世界应用而言,其可靠性仍然不足。"

弥合实验室演示与真实世界应用之间的差距

为了提升机器人在真实动态环境中的表现,Kun Lei 及其同事尝试将传统模仿学习策略与强化学习结合起来训练机器人策略(robotic policies)。

模仿学习是指向机器人算法输入人类完成任务的视频(即人类示范),使其学习如何执行相应任务。相比之下,强化学习则通过不断试错进行训练,当 AI 系统采取正确行动时给予奖励,从而不断优化其决策能力。

Kun Lei 表示:" 我们思考,强化学习是否可以像基础模型(foundation models)的后训练(post-training)一样,作为机器人策略的后训练阶段。我们的核心目标,是弥合从示范到可靠执行之间的‘最后一公里’差距,不仅提升任务成功率,还提高执行速度、鲁棒性以及从错误中恢复的能力。"

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 上海 效果 人工智能 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论