
强化学习,正重新成为机器人智能持续演进的重要技术。
作者丨董子博
编辑丨马晓宁
AI 科技评论独家获悉,近日,强化学习专家孙鹏正式加入星尘智能,在业内被视为后者正提前布局机器人强化学习后训练的重要信号。
孙鹏博士毕业于清华自动化系,师从信息处理研究所周杰教授,后在康奈尔大学和罗格斯大学完成博后项目,与担任其博士后 Advisor 的张潼教授渊源颇深。2016 年,孙鹏加入了彼时张潼领衔的腾讯 AI Lab,任高级研究员;后来到张正友领衔的腾讯 Robotic X 实验室,任智能体学习中心的团队负责人。
2020 年,孙鹏加入字节跳动,在游戏 AI 部门负责多智能体、分布式大规模强化学习技术,主导开发强化学习基础设施 ByteRL,支撑字节多款自研游戏 AI 训练和定制;还带队获得 IEEE CoG 2023 策略卡牌 AI 竞赛冠军,其《炉石传说》AI 曾在测试中以全胜战绩击败国服排名前十的游戏主播,验证了大规模强化学习在复杂决策任务中的产业化能力。
在字节 AI Lab / ByteResearch 期间,孙鹏作为项目负责人参与研究并发布强化微调方法 R eFT,以及数学推理智能体 DeltaProver,其中 ReFT 以超越传统的数学微调能力, 甚至被认为影响到了 OpenAI o1 式的推理范式;其在 Seed 团队参与模型 RLHF 与预训练工作,将强化学习进一步拓展至大模型对齐、推理增强和 Agent 方向。
▎机器人 RL 后训练时代来临
过去两年,大模型帮助机器人获得了语言理解、任务规划和泛化能力,VLA 模型解决的是机器人 " 知道该做什么 " 的问题。
但机器人进入真实环境后,还需要不断面对新的工具、新的场景和新的失败案例。如何根据真实反馈不断调整策略、优化动作,持续学习和进化,正成为 Physical AI 下一阶段的核心挑战。
强化学习正重新成为机器人智能持续演进的重要技术,也让同时具备机器人强化学习、大规模 RL 系统工程、RLHF 和推理强化训练经验的人才变得愈发稀缺。
星尘智能在八月结束的世界机器人大会,刚刚展示最新发布的世界首个隐式世界动作模型 Lumo-2,强调模型 " 先预测未来,再生成动作 ",模型前端配备 Agent Philia,具备长期记忆、多机器人协同调度、与人自然交互等能力,而模型后端的强化学习,将决定机器人如何在真实世界中不断成长。
孙鹏的加入将进一步加强星尘智能在机器人强化学习及后训练方面的研发能力。未来,公司计划结合世界模型、具身 OS 与绳驱机器人本体,探索机器人在真实环境中的持续学习和策略优化。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。


登录后才可以发布评论哦
打开小程序可以发布评论哦