PulseAugur
实时 23:20:15
English(EN) Really interesting paper.

ClawGym II 框架通过异构组合器增强 AI 代理训练

一篇新论文介绍了一个名为 ClawGym II 的框架,该框架旨在通过利用 OpenClawClaude Code 等现有工具来训练 AI 代理。该系统捕获与这些工具的交互,并将它们组织成前缀树,以使用近端策略优化 (PPO) 和 GRPO 来优化模型。研究表明,使用 OpenClaw 可使 Qwen3-30A3B 模型的 Pass@1 分数提高 9.98 分,使用 Claude Code 可提高 14.81 分。此外,该研究还探讨了混合组合器训练,即通过多个异构组合器优化单个模型,以增强跨不同执行系统的泛化能力。 AI

影响 这项研究可能带来更强大的 AI 代理,使其能够更好地泛化到不同的工具和环境。

排序理由 该集群描述了一篇研究论文,其中详细介绍了一个用于训练 AI 代理的新框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 X — Omar Sanseviero (HF research) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

ClawGym II 框架通过异构组合器增强 AI 代理训练

报道来源 [1]

  1. X — Omar Sanseviero (HF research) TIER_1 English(EN) · omarsar0 ·

    Really interesting paper.

    Really interesting paper. I recommend it to anyone interested in training agents using existing harnesses. (bookmark it) ClawGym II runs RL through OpenClaw and Claude Code as opaque boxes. A serving proxy sits at the model boundary and captures every call the harness makes, h…