PulseAugur
实时 04:56:57
English(EN) On the Impossibility of Unbiased and Length-Invariant Policy Optimization with Outcome Rewards

新定理揭示大型语言模型策略优化中不可避免的权衡

一篇新的研究论文建立了关于大型语言模型强化学习中策略优化不可能性定理。该论文证明,在标准结果奖励和组相对策略优化(GRPO)设置下,没有任何基于长度的加权方案能够同时实现无偏梯度估计和长度不变性。GRPO近似长度不变性但存在梯度偏差,而提出的改进方法Dr. GRPO实现了无偏梯度但引入了长度偏差,可能不成比例地影响较长的轨迹。 AI

影响 这一理论发现突显了当前大型语言模型强化学习技术的根本局限性,表明需要新的方法来平衡梯度准确性和轨迹长度的考量。

排序理由 该集群包含一篇详细阐述理论不可能性定理的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新定理揭示大型语言模型策略优化中不可避免的权衡

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Fei Ding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Huiming Yang ·

    关于基于结果奖励的无偏且长度不变策略优化之不可能

    arXiv:2607.23364v1 Announce Type: new Abstract: Group Relative Policy Optimization (GRPO) is the dominant reinforcement learning algorithm for training reasoning capabilities in large language models, notably adopted by DeepSeek-R1. The recent improvement Dr. GRPO (COLM 2025) ide…