PulseAugur
实时 08:30:00
实体 Yuki Ichihara

Yuki Ichihara

PulseAugur coverage of Yuki Ichihara — every cluster mentioning Yuki Ichihara across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_160929 ·

    新的MO-GRPO算法解决了多目标强化学习中的奖励破解问题

    研究人员推出了一种名为MO-GRPO的新算法,旨在解决多目标强化学习中的奖励破解问题。该新方法通过引入一种简单的归一化技术,根据奖励函数的值方差自动重新加权奖励函数,从而扩展了群体相对策略优化(GRPO)。MO-GRPO确保所有目标在损失函数中做出公平的贡献,无需手动缩放即可保持偏好顺序。在多臂老虎机、模拟控制任务、机器翻译和指令遵循等多个领域的实验评估表明,MO-GRPO能够实现稳定的学习,并且优于标准的GRPO。