一篇新论文介绍了一个名为 ClawGym II 的框架,该框架旨在通过利用 OpenClaw 和 Claude Code 等现有工具来训练 AI 代理。该系统捕获与这些工具的交互,并将它们组织成前缀树,以使用近端策略优化 (PPO) 和 GRPO 来优化模型。研究表明,使用 OpenClaw 可使 Qwen3-30A3B 模型的 Pass@1 分数提高 9.98 分,使用 Claude Code 可提高 14.81 分。此外,该研究还探讨了混合组合器训练,即通过多个异构组合器优化单个模型,以增强跨不同执行系统的泛化能力。 AI
影响 这项研究可能带来更强大的 AI 代理,使其能够更好地泛化到不同的工具和环境。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一个用于训练 AI 代理的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
在 X — Omar Sanseviero (HF research) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →