实体
Big-Math
Big-Math
PulseAugur coverage of Big-Math — every cluster mentioning Big-Math across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的SCOPE-RL框架优化LLM推理路径,提高准确性和效率
研究人员开发了SCOPE-RL,一个新颖的两阶段框架,旨在通过优化大型语言模型(LLM)的推理过程来增强其强化学习能力。该方法引入了更细粒度的奖励信号,在成功结果之前和之后都提供反馈,这有助于区分有效的推理路径和效率较低或有缺陷的路径。实验表明,与仅基于结果的标准强化学习相比,SCOPE-RL显著提高了准确性并减少了推理中使用的token数量。
-
新恒等式统一三种语言模型训练方法
一篇新论文介绍了分组标准差恒等式(Group-Standard-Deviation Identity),证明了三种流行的语言模型训练方法——GRPO、Dr. GRPO 和 DAPO——本质上是对单个参数的调整:采样答案分歧的标准差。该恒等式揭示了标准差直接与训练更新的大小相关,一致同意不产生学习,而答案分歧则提供最重要的训练信号。研究通过 Big-Math 数据集和受控训练运行验证了这些发现,强调了该参数在决定学习效果和重点方面的关键作用。