OpenForgeRL:让智能体在真实推理框架中端到端训练
2026年7月23日,研究团队在 arXiv 上发表了题为《OpenForgeRL: Train Harness-native Agents in Any Environment》的论文(arXiv:2607.21557),提出了一种名为 OpenForgeRL 的开源框架。该框架旨在解决现代 AI 智能体在复杂推理框架(Harness)下难以进行端到端强化学习训练的痛点,实现了在真实部署环境中直接训练和优化工具调用及 GUI 操作智能体。
一、困境:推理与训练的“两条平行线”
随着 AI 智能体技术的发展,像 Claude Code、Codex 和 OpenClaw 这样的“推理框架”(Inference Harnesses)已经成为了驱动多轮推理、工具使用和外部系统访问的核心组件。
然而,这些复杂的推理框架通常状态丰富且涉及多进程交互,导致它们难以与标准的开源训练基础设施(如 SFT/RL 栈)兼容。现有的训练堆栈无法原生表达这些具有状态的多进程推理过程,使得研究人员很难直接在真实的智能体运行环境中对模型进行端到端的强化学习优化。
这种“训练”与“推理”环境的脱节,就像让运动员在平静的游泳池里练习动作,却要在波涛汹涌的大海中去比赛——限制了智能体在实际复杂任务中的可靠性提升。
二、破局:解耦训练与推理的架构设计
为了应对这一挑战,OpenForgeRL 提出了一种通过轻量级代理(Proxy)和编排器来解耦训练与推理的架构。其核心技术组件包括:
- 轻量级代理(Lightweight Proxy):该组件拦截并服务于推理框架的模型调用,同时将这些调用记录为标准强化学习代码库(如 veRL)所需的训练数据。这使得研究人员可以在不修改原有复杂推理框架代码的情况下,获取用于 RL 训练的轨迹数据。
- Kubernetes 编排器:利用 Kubernetes 集群,OpenForgeRL 为每一次 rollout(推理回合)启动独立的远程容器。这种设计不仅实现了隔离,还支持在大规模环境下并行运行不同环境中的智能体。
通过这种设计,OpenForgeRL 允许研究者直接在智能体实际部署的推理框架和环境(如 Claw-based agents 或 Multimodal GUI browser agents)中进行训练、研究和改进。
三、战绩:小样本实现大跨越
研究团队在多种复杂的推理框架和环境(涵盖工具/Claw 智能体以及多模态 GUI 浏览器/计算机使用智能体)上验证了该框架的有效性。实验结果表明,仅使用数百至数千个任务,OpenForgeRL 就能显著提升智能体的性能,并在多个基准测试中超越同规模的开放基线模型。
1. 工具调用智能体(OpenForgeClaw)
在使用 Claw 相关基准测试时,OpenForgeClaw 取得了以下成绩:
- ClawEval:Pass@3 达到 31.7,Pass^3 达到 55.9。
- QwenClawBench:得分达到 33.7。
2. GUI 操作智能体(OpenForgeGUI)
在多模态 GUI 操作场景中,OpenForgeGUI 的表现如下:
- OSWorld-Verified:得分为 37.7。
- Online-Mind2Web:得分为 63.0。
- WebVoyager:得分为 72.3。
在 GUI 设置下,该模型的性能匹配甚至超过了一些体积大数倍的模型,并且几乎在所有基准测试中都优于同等大小的开放基线模型。
四、洞察:框架选择与 RL 的深层影响
除了性能提升,研究团队还深入分析了推理框架的选择(如 ZeroClaw、OpenClaw、Codex)以及强化学习(RL)对智能体行为的具体影响,得出以下结论:
- 学习难度差异显著:不同的推理框架在训练过程中表现出巨大的难度差异,某些框架下的智能体比其他框架更难学习。
- RL 提升了可靠性:强化学习显著改善了智能体的多项能力,包括自我验证(self-verification)、工具覆盖范围(tool coverage)以及完成多步计划(multi-step plans)的能力。
- 薄弱环节依然存在:尽管有显著提升,但在错误恢复(error recovery)等关键能力方面,智能体仍然表现得较为薄弱。
五、结语:在真实战场中锻造更可靠的智能体
OpenForgeRL 通过解耦训练与推理流程,为 AI 智能体的开发提供了一条新路径。它证明了在真实、复杂的部署环境中直接进行端到端强化学习是可行且高效的。
对于 AI 从业者和开发者而言,这一框架不仅提供了在任意环境中训练智能体的基础设施,还揭示了不同推理框架对模型学习效果的深远影响。未来,如何解决智能体在错误恢复等关键场景下的脆弱性,以及如何进一步优化在不同推理框架下的学习效率,将是基于此类框架研究的重点方向。
参考链接:
* arXiv 页面:https://arxiv.org/abs/2607.21557
* 论文 PDF:https://arxiv.org/pdf/2607.21557
* DOI:https://doi.org/10.48550/arXiv.2607.21557