一篇新的研究论文质疑了在具有可验证奖励的强化学习(RLVR)中使用的难度标签的可靠性。研究表明,先前被认为不可学的提示实际上可能会得到改进,尽管速度较慢,并且难度标签本身的重现性不如预期。研究人员提出了一个框架来量化这种不稳定性,并确定可靠难度分配所需的评估深度,同时重新审视了用于解释慢学习现象的梯度相似性证据。 AI
影响 挑战了关于模型学习能力及其测量方法的现有假设。
排序理由 该集群包含一篇讨论新研究发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →