
作者 | 陈骏达
编辑 | 心缘
智东西 8 月 18 日报道,昨天,中国人民大学高瓴人工智能学院、至知创新研究院团队联合提出了一个面向复杂 Agent Harness 的黑盒强化学习框架 ClawGym II。

在 Part I 中,团队围绕这一目标,率先打通了从高质量任务合成、真实 Agent 交互轨迹收集,到模型训练与系统化评测的完整链路,并验证了利用真实 Agent 系统产生的交互数据训练专用模型、提升 Agent 能力的可行性。相关工作已开源在:
https://github.com/ClawGym。
在此基础上,ClawGym II 进一步将真实 Agent Harness 直接纳入强化学习闭环:无需改动 Claude Code、OpenClaw 等 Harness 的内部实现,即可让模型通过其真实执行过程进行强化学习,并支持多个异构 Harness 联合训练同一个策略模型。
实验显示,通过 OpenClaw 和 Claude Code 进行黑盒 RL 均能稳定提升模型的 Agent 任务能力;进一步将不同 Harness 产生的 rollout 纳入统一训练后,一个共享策略模型也能够同时从多个异构 Harness 中学习。
论文链接:
https://arxiv.org/abs/2608.16798。
一、更强的Harness,模型未必会用
Agent Harness 已成为现代智能体系统的执行基础。它把系统提示、工具接口、上下文管理、工作流和错误恢复等机制整合在一起,让模型能够在复杂环境中持续交互、完成长程任务。
Claude Code、Codex、OpenClaw 等系统的发展也表明,Harness 正在成为影响 Agent 能力的重要因素。但更强的 Harness 并不意味着模型能自然用好这些能力——面对更复杂的工具、交互协议和执行机制,模型仍要学习如何规划、决策并与环境交互。
ClawGym II 延续了 ClawGym 围绕真实 Agent 系统训练模型的研究路线,但进一步把问题从 " 利用 Harness 产生的交互数据训练模型 ",推进到 " 直接通过 Harness 进行强化学习 "。
它试图回答一个更进一步的问题:能否直接通过真实、复杂的 Agent Harness 持续优化模型本身?
对于 Claude Code、OpenClaw 这类复杂系统,其内部控制流和执行逻辑对训练系统不可见,团队将这一设定称为黑盒强化学习(Black-box RL):Harness 保持原有执行逻辑不变,训练系统只基于其产生的交互轨迹优化底层策略模型。
直接通过复杂黑盒 Harness 做强化学习,首先要过三道坎。
第一道是可扩展且稳定的执行基础设施:通用 Agent 任务依赖独立且有状态的运行环境,大规模并发 rollout 与长程交互中的延迟、异常和失败,都可能影响训练稳定性。
第二道是从碎片化黑盒轨迹中进行有效优化:黑盒 Harness 暴露给训练系统的只是分散、分叉甚至冗余的模型调用,完整的多轮训练轨迹并不可见,Harness 内部的消息处理还可能进一步带来训练 - 推理不一致。
第三道是跨异构 Harness 的可扩展性:不同 Harness 在交互协议、工具接口、上下文管理和工作流上差异显著,训练框架需要以较低的适配成本支持不同 Harness,并进一步实现统一训练。
二、执行与优化解耦:Sandbox 隔离跑任务,模型边界抓数据
针对这三道坎,ClawGym II 的核心思路是将 Harness 执行与策略优化解耦:Harness 保持原生执行逻辑,负责工具调用、上下文管理、重试恢复、subagent 调度以及环境交互;训练系统则在模型服务边界捕获模型侧信息,结合任务奖励完成轨迹构建与策略更新。
由此,无需重新实现 Harness 内部复杂的控制流程,即可直接通过不同 Harness 对模型进行强化学习。
执行层面,ClawGym II 将每个任务环境与对应 Harness 一同运行在临时 Sandbox 中。通用 Agent 任务的一条 rollout 会在多轮交互中持续修改文件、进程和工具状态,Sandbox 在 rollout 开始时按需创建、结束后释放,为每条 rollout 提供相互隔离的工作空间和运行环境,支撑大规模并发执行。
除 Harness 原生提供的工具外,网页搜索等通用能力以及任务特定工具还可以通过 MCP 接入,无需修改 Harness 原有工作流。模型侧信息则通过模型边界捕获:虽然 Harness 内部控制流不可见,但所有模型行为最终都必须经过模型服务边界。
团队在 Harness 与策略模型之间部署了 Serving Proxy,作为 Harness 的模型服务端点调用当前 rollout policy 完成生成,同时记录输入 token、生成 token、rollout log-probability 和任务信息。
任务结束后,Verifier 根据最终环境状态计算 reward,并将奖励与调用记录一同送入训练流程。针对真实 Harness 执行中的超时、连接异常和轨迹缺失等问题,框架还加入了容错与过滤机制,保证长时程 rollout 的可靠性。
三、前缀树拼回碎片轨迹,多 Harness 联合训练
Serving Proxy 捕获到的模型调用只是黑盒 Harness 在 serving boundary 上暴露出的碎片记录,无法直接作为完整多轮轨迹训练:相邻调用往往包含大量重复历史,而 retry、context compaction、subagent 等机制还可能让一次 rollout 产生多个共享历史的执行分支。
为此,团队提出了基于前缀树的轨迹重建(Prefix-Tree Reconstruction):将同一次 rollout 中捕获的模型调用组织成一棵前缀树,相同交互历史合并为公共前缀,不同后续执行保留为独立分支,同时恢复 Harness 插入的工具结果和环境反馈,使每条 root-to-leaf 路径重新对应一条完整的多轮交互轨迹。
但前缀树中的所有分支并非都具有有效训练信号。框架进一步执行轨迹过滤与树结构优化:移除 retry 产生的 dead leaves,过滤 context compaction、subagent 等难以与最终任务 reward 建立可靠 credit assignment 的辅助轨迹,并直接丢弃异常过度分叉的 rollout。
过滤后,一次 rollout 仍可能保留多条共享历史的有效轨迹,它们共同对应同一个 workspace 终态和 rollout-level reward。
训练时,所有有效分支均参与优化,但共享前缀在整棵树中只计算一次 loss,各分支独有的后续 token 分别参与更新,从而避免因轨迹分叉而重复训练相同历史,也避免高度分叉的 rollout 获得不成比例的训练权重。
在此基础上,团队进一步使GRPO 与 PPO 适配一对多的树状轨迹结构。对于 GRPO,reward normalization 仍然在同一任务的多个 rollout 之间进行,每个 rollout 得到一个统一的 advantage,再广播到该 rollout 恢复出的全部有效轨迹 .
对于 PPO,则将同一 rollout 中的不同分支独立进行 advantage estimation,不在兄弟分支之间传播 advantage,从而在保留 rollout-level reward 语义的同时,使传统策略优化算法能够处理黑盒 Harness 产生的 forked trajectories。
除了轨迹结构,黑盒训练还必须解决训练与推理的一致性(Training – Inference Consistency)。在 token 层面,团队采用Black-box Token-in-Token-out:为每次模型调用维护彼此解耦的 Harness 视图和训练视图。推理引擎实际生成的原始 token 被直接记录并作为训练的唯一模型输出,而解码后的结构化文本只交给 Harness 执行;即使 Harness 随后进行了格式规范化、重新序列化等操作,也不会覆盖训练侧保存的原始 token。
进一步地,团队在 probability 层面采用token-level importance-sampling rollout correction,修正推理引擎与训练引擎重新计算概率时产生的偏差,从 token sequence 和 token probability 两个层面共同降低 off-policy bias。
当 Harness 的执行逻辑与策略优化被彻底解耦后,整个训练流程也不再绑定某一种 Harness 的内部实现。基于这一点,团队进一步提出Mix-Harness Training:将Task – Harness Pair作为基本训练实例,让 OpenClaw、Claude Code 等不同 Harness 产生的 rollout 随机混合进入同一个 training batch,共同优化一个共享策略模型。
对于 GRPO,advantage normalization 在各自的 Task – Harness Pair 内独立进行,避免不同 Harness 的交互模式和 reward distribution 干扰相对优势估计;而不同 Harness 产生的梯度最终仍在同一步策略更新中聚合。由此,ClawGym II 不仅能够通过任意单一黑盒 Harness 直接训练模型,也进一步实现了跨异构 Harness 的统一联合强化学习。
四、跨越多类复杂任务,黑盒 RL 均实现稳定提升
团队以 Qwen3-30B-A3B 为主要骨干模型,分别考察了单一 Harness 训练与 Mix-Harness 训练两种设置。在 OpenClaw 与 Claude Code 两个结构差异显著的 Harness 上,黑盒 RL 均带来了显著且可迁移的性能提升:ClawII-OC-30A3B 与 ClawII-CC-30A3B 在 ClawGym-Bench 上相比各自初始化模型分别提升 9.98 和 14.81 分,在 PinchBench 上提升分别达到 11.71 和 17.28 分。


实验结果显示,该模型在两个 Harness 上都能保持与对应单 Harness 训练相当的 training reward 和下游评测表现,整个训练过程保持稳定,说明来自不同 Harness 的学习信号可以在统一框架中被有效联合优化,一个共享策略模型能够同时适配多个异构 Harness。

其中,JobBench 面向复杂职业工作流,涉及图片、数据库及 Office 文件等多种数据形式,要求 Agent 跨文件理解并完成实际工作产物;OfficeQA 则侧重大规模文档中的检索、分析与多步推理,最终生成可验证答案。
针对两类任务,团队分别合成 JobBench-style 和 OfficeQA-style 训练数据,并以 Qwen3-30B-A3B 为骨干模型、Claude Code 为 Harness 进行黑盒 RL。得益于统一的任务接口,新任务只需定义任务指令、初始化工作空间和验证器,即可直接接入现有训练流程,无需修改底层 RL 框架。
实验结果显示,模型在 JobBench-Easy 上由 20.46 提升至 27.20,在 OfficeQA-Full 上由 8.53 提升至 21.54,两组训练的 reward 也均保持稳定上升。
这表明,ClawGym II 能够跨越不同任务形式,从复杂 Workspace 操作到长文档检索与推理,都可以在同一套黑盒 RL 框架下进行稳定、有效的策略优化。

当这一模型直接切换到未参与训练的 OpenClaw 上执行时,仍能达到 50.33,相比初始模型提升 5.22 分,说明简单 AgentLoop 中学到的部分通用 Agent 能力具有一定的跨 Harness 迁移性。但这种迁移并不足以完全适应复杂 Harness:直接通过 OpenClaw 进行黑盒 RL 的 ClawII-OC-30A3B 在相同评测下达到 62.62,明显高于白盒训练模型。
面对真实 Harness 中更复杂的交互协议与执行机制,仅依赖白盒训练仍有差距,直接通过目标 Harness 进行优化才能更充分地适应其实际执行机制。

如今,Harness 不再只是模型能力的执行载体,也可以直接成为模型学习和提升的环境。ClawGym II 的实验验证了这种训练范式的可行性:不同形态的真实 Harness 能够接入统一的优化框架,并共同推动同一个策略模型学习。
未来,团队将继续围绕真实 Agent 系统中的学习与演进展开研究,关注模型如何在持续交互和真实执行过程中不断适应环境、积累经验并提升能力。沿着这一方向,ClawGym 将继续推动真实 Agent 系统中的模型学习与能力演进,为通用智能体的发展提供基础支撑。


登录后才可以发布评论哦
打开小程序可以发布评论哦