研究人员发现Proximal Policy Optimization (PPO) 中存在一种称为价值平坦化(Value Flattening)的故障模式,在这种模式下,即使实际值急剧变化,Critic估计的状态值在中间状态下也会变得平坦。这种现象在更大的状态空间中会加剧,并可能导致冗余更新。为了解决这个问题,该论文引入了稀疏近端策略优化(SParse Proximal Policy Optimization, SP$^3$O),它仅对每次响应中少数分隔良好的状态应用价值损失。在Qwen3-Base上的实验表明,SP$^3$O能有效缓解价值平坦化并改善策略学习。 AI
影响 通过解决Critic学习中的特定故障模式,引入了一种改进大型语言模型策略学习的方法。
排序理由 详细介绍LLM强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- FrozenLake
- Proximal Policy Optimization
- Qwen3-Base
- SP$^3$O
- SParse Proximal Policy Optimization
- Value Flattening
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →