实体
mathematical reasoning benchmarks
mathematical reasoning benchmarks
PulseAugur coverage of mathematical reasoning benchmarks — every cluster mentioning mathematical reasoning benchmarks across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的RL方法W2SPO通过短辅助分支改进LLM推理
研究人员开发了一种新的离策略强化学习方法W2SPO,旨在提高大型语言模型的推理能力。该技术通过在模型轨迹中注入短的、8个token的辅助片段来解决标准方法中奖励对比度有限的问题。然后,策略更新将集中在这些片段上,利用最终可验证的奖励。W2SPO在4B规模模型的数学推理基准测试中表现出优越的性能,优于现有的后训练基线,并实现了显著的训练加速。
-
随机回溯提升语言模型推理效率
研究人员开发了一种名为随机回溯的新方法,以提高语言模型在测试时扩展的效率。该技术允许模型重新访问先前生成的状体,而不是仅仅扩展当前解决方案的前沿。通过采用子池选择和结合序列蒙特卡洛方法的增强回溯,该方法旨在提高准确性,同时减少推理过程中生成的总令牌数。在数学推理基准上的实验表明,与现有方法相比,每令牌的准确性有所提高。