新浪财经 昨天
星尘发布在线强化学习框架SmoothRL,实现与大模型的异步推理
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

新浪科技讯 9 月 4 日上午消息,近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。解决的是大模型异步推理成为真实部署常态后,与之适配的 online RL 到底该从哪些动作里学。

SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。

过去几年,机器人基础模型主要解决的是 " 会不会 ":用更多数据、更强模型,把能力做宽。但机器人真正进入真实环境以后,新的问题往往不是完全不会,而是差几毫米、差半拍,或者换一个物体位置就不够稳定。

SmoothRL 关注的是这之后的一层:一个已经具备基础能力的 pretrained policy,进入真实世界以后,能不能继续根据真实执行结果修正自己。SmoothRL 指向的是一个正在变得越来越具体的问题:预训练让机器人学会怎么做,真实世界里的后训练,再把这些能力练得更准、更稳、更可靠。

在模型全面发展时,星尘 "AI 模型 - 具身 OS- 绳驱本体 " 的全栈系统也在持续迭代,推动 Physical AI 的应用与规模化部署。

下一步,团队计划进一步探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 科技讯 新浪 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论