研究人员推出了一种名为相关性归一化GRPO(CorrGRPO)的新方法,用于训练具有多个奖励信号的推理语言模型。这种新方法解决了标准组相对策略优化(GRPO)中大规模奖励可能掩盖较小奖励的局限性。CorrGRPO将成对协方差归一化为皮尔逊相关系数,确保不同奖励成分的影响更加均衡。该方法已在0.5B到8B参数的模型上,在代码生成、工具调用和代理安全任务中展现出改进。 AI
影响 提高了多奖励语言模型的训练效率和性能,可能带来更强大的AI代理。
排序理由 该集群描述了研究论文中提出的一种用于训练语言模型的新方法。
- agent security
- arXiv
- code generation
- CorrGRPO
- Group Relative Policy Optimization
- Grpo
- Hugging Face
- tool calling
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →