PulseAugur
实时 14:10:51
实体 Pass@1

Pass@1

PulseAugur coverage of Pass@1 — every cluster mentioning Pass@1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_109549 ·

    新的SR-PPO方法通过单次采样改进语言模型的强化学习

    研究人员开发了一种名为单次采样近端策略优化(SR-PPO)的新方法,以解决语言模型强化学习中估计token级优势的挑战。该方法使用在每次提示的单次采样上训练的蒙特卡洛Pass@k评论员来改进信用分配并降低计算成本。该方法在HMMT26和AIME24等数学推理基准上显示出稳定的学习和持续的成功率提升。

  2. RESEARCH · CL_109577 ·

    新的局部分支路由框架增强语言模型推理能力

    研究人员开发了一个名为局部分支路由(LBR)的新框架,以在测试时扩展期间提高语言模型的推理能力。LBR 在 token 级别运行,扩展局部前瞻树并使用轻量级路由器选择最有希望的分支。该方法通过利用候选未来的隐藏状态,实现了更高效且可训练的扩展,在数学推理基准测试中通过提高 Pass@1 和 Pass@32 分数而优于现有方法。

  3. TOOL · CL_93283 ·

    新研究将RLVR多样性崩溃视为过拟合

    一篇新发表在arXiv上的研究论文探讨了“多样性崩溃”现象,这在强化学习与可验证奖励(RLVR)中出现,RLVR是一种用于增强大型语言模型推理的技术。该论文将此问题视为一种过拟合,即模型过度关注已解决的问题,导致高k Pass@k指标下降。研究人员提出了一种名为贝叶斯边界门控(BBG)的新方法来缓解这一问题,通过将优化从过拟合问题中引导开,并在推理基准测试中显示出改进。