研究人员推出了一种名为“无界正向非对称优化”(Unbounded Positive Asymmetric Optimization, UP)的新型目标函数,旨在改进大型语言模型(LLMs)的强化学习(RL)。UP通过允许正向优势的梯度无限制,从而增强探索,同时保持对负向优势的梯度裁剪,以防止训练不稳定,从而解决了当前RL框架中固有的探索-稳定性困境。这种即插即用的目标函数已在各种RL算法、模型架构和训练模式中展现出提高推理准确性的能力。 AI
影响 这一新的优化目标通过在强化学习中增强探索能力,从而提高LLM的推理能力,可能带来更稳定、更强大的LLM。
排序理由 该集群描述了一篇关于LLM强化学习新优化目标的新研究论文。
在 Hugging Face Daily Papers 阅读 →
- DAPO
- GRPO
- large language models
- Probability Capacity
- reinforcement learning
- Unbounded Positive Asymmetric Optimization
- importance sampling
- LLMs
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →