硅屿手记 8小时前
环境供给成智能体RL新瓶颈,腾讯这篇论文把难度拉高了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智能体强化学习(Agent RL)正在撞上一堵新墙——不是算力,不是模型,而是环境供给。腾讯最近发布的一篇论文,把这个问题摆上了台面:环境供应正在成为智能体 RL 的主要限制因素。这篇论文值得一读,建议先收藏。

环境不够难,智能体就学不到东西

智能体 RL 需要持续供给足够难的环境,才能教会模型新东西。难度不够,训练就变成了重复劳动。最近的方法倾向于从智能体自身 rollout( rollout,即智能体在环境中执行动作产生的轨迹)中暴露的弱点来构建环境——智能体哪里表现差,就针对哪里设计新关卡。

这个思路听起来顺理成章,但论文指出了两个致命问题。第一,这样生成的环境会继承智能体自身的盲区,导致泛化能力差——模型在训练环境里表现不错,换到新场景就抓瞎。第二,随着智能体能力提升,它暴露出的弱点会越来越少,可供构建环境的素材随之减少,学习信号也就越来越弱。这是一个恶性循环:越强,越难变强。

不看智能体,直接进化环境

腾讯这篇论文的解法是环境进化(Environment Evolution)——完全不观察智能体的行为,直接让环境变难。论文从多轮训练目标(multi-turn training objective)中推导出三种让环境变难的方法,然后按固定计划逐代应用。换句话说,环境难度的提升不再依赖智能体的弱点暴露,而是从训练目标本身出发,主动设计更难的任务。

这种方法的好处在于,环境难度的提升是系统性的,不会继承智能体的盲区。而且由于不依赖智能体的 rollout,即使模型变强了,环境供给也不会因此衰减。

先验证难度,再上强度

论文在信任生成器之前先做了测试。Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 这三个模型在进化后的环境上表现都更差,这直接确认了环境难度的提升是真实有效的。这个验证步骤很关键——如果生成的环境连更强的模型都能轻松通过,那说明难度提升是假的。

验证通过后,论文在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上跑了纯长程 RL(long-horizon RL,即长时间跨度的强化学习训练)。结果相当亮眼:在 Terminal-Bench 2.1 基准上,两个模型分别提升了 14.4 分和 18.0 分。这个提升幅度在基准测试里不算小,而且是在没有额外环境设计成本的情况下拿到的。

环境供给,下一个兵家必争之地

这篇论文的价值在于它把 " 环境供给 " 这个被忽视的环节推到了台前。过去几年,智能体 RL 的进步主要靠模型规模、算力堆叠和算法优化,环境设计一直是个手工作坊式的活。腾讯这篇论文展示了一条自动化路径:不依赖智能体行为,直接从训练目标推导环境难度提升方法,按固定计划逐代应用。

如果这条路走得通,环境供给将从瓶颈变成杠杆。智能体 RL 的训练效率、泛化能力都有望上一个台阶。当然,论文目前展示的结果还集中在 Terminal-Bench 2.1 这个基准上,更广泛的任务泛化效果还需要更多验证。但方向已经清晰:环境进化,可能是智能体 RL 下一个值得押注的技术点。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论