研究人员推出了一种名为MO-GRPO的新算法,旨在解决多目标强化学习中的奖励破解问题。该新方法通过引入一种简单的归一化技术,根据奖励函数的值方差自动重新加权奖励函数,从而扩展了群体相对策略优化(GRPO)。MO-GRPO确保所有目标在损失函数中做出公平的贡献,无需手动缩放即可保持偏好顺序。在多臂老虎机、模拟控制任务、机器翻译和指令遵循等多个领域的实验评估表明,MO-GRPO能够实现稳定的学习,并且优于标准的GRPO。 AI
影响 引入了一种提高多目标强化学习任务稳定性和性能的方法。
排序理由 这是一篇详细介绍强化学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →