研究人员推出了一种名为 Headroom-Drift Replay 的新型回放控制原语,旨在提高 GRPO(门控循环策略优化)在强化学习中的效率。该方法将回放决策分为两个阶段:Headroom,根据存储轨迹剩余的学习价值对其进行排名;Drift,根据与当前策略的兼容性对其进行过滤。在数学推理、多模态推理和 Agentic Search 基准测试中进行测试,Headroom-Drift Replay 的表现优于朴素回放,并能与更广泛的回放技术相媲美或超越。值得注意的是,在环境交互成本高昂的 Agentic Search 场景中,它以显著减少的实际运行时间实现了可比的质量。 AI
影响 这种回放控制原语可以通过更有效地重用过去的数据,显著降低复杂人工智能推理代理的训练成本。
排序理由 该集群描述了在 arXiv 上的一篇学术论文中提出的一种新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →