研究人员推出ARISE-RL,一个旨在利用强化学习改进开放式代理训练的新框架。该框架通过将任务/评分标准生成器与推理求解器相结合,解决了缺乏可验证答案和可扩展评分标准等挑战。ARISE-RL采用协同演化方法,其中生成器根据工具观察创建任务,求解器从评分标准满意度信号中学习。该系统还包含奖励门控自我演化蒸馏(RG-SED)来优化策略并减少对嘈杂指导的模仿。为了便于评估,研究人员开发了ECR-Bench,一个用于深度研究和多工具规划任务的基准套件,展示了ARISE-RL的先进性能。 AI
影响 该框架可能带来更强大、更鲁棒的开放式AI代理,提高在复杂推理和规划任务上的性能。
排序理由 该集群包含一篇详细介绍AI代理新框架和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →