PulseAugur
实时 09:31:32
English(EN) MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems

新的MO-GRPO算法解决了多目标强化学习中的奖励破解问题

研究人员推出了一种名为MO-GRPO的新算法,旨在解决多目标强化学习中的奖励破解问题。该新方法通过引入一种简单的归一化技术,根据奖励函数的值方差自动重新加权奖励函数,从而扩展了群体相对策略优化(GRPO)。MO-GRPO确保所有目标在损失函数中做出公平的贡献,无需手动缩放即可保持偏好顺序。在多臂老虎机、模拟控制任务、机器翻译和指令遵循等多个领域的实验评估表明,MO-GRPO能够实现稳定的学习,并且优于标准的GRPO。 AI

影响 引入了一种提高多目标强化学习任务稳定性和性能的方法。

排序理由 这是一篇详细介绍强化学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MO-GRPO算法解决了多目标强化学习中的奖励破解问题

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yuki Ichihara, Yuu Jinnai, Tetsuro Morimura, Mitsuki Sakamoto, Ryota Mitsuhashi, Eiji Uchibe ·

    MO-GRPO:多目标问题中群体相对策略优化奖励欺骗的缓解

    arXiv:2509.22047v3 Announce Type: replace Abstract: Group Relative Policy Optimization (GRPO) has been shown to be an effective algorithm when an accurate reward model is available. However, such a highly reliable reward model is not available in many real-world tasks. In this pa…