PulseAugur
实时 14:10:51
实体 pass@k

pass@k

PulseAugur coverage of pass@k — every cluster mentioning pass@k across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_160729 ·

    新研究识别RLVR中的pass@k反转,并提出缓解策略

    一篇新的研究论文探讨了在可验证奖励强化学习(RLVR)中出现的“pass@k反转”现象。当RLVR提高模型单样本准确率,但降低其在需要多次尝试(更高k)的任务上的表现时,就会发生这种情况。该论文认为这是由于证据缺失导致的失败,即在RLVR训练过程中,稀有的正确轨迹会丢失。一种名为“逐问题基准锚定”(PBA)的提议方法,旨在通过优化提示并根据基准模型的分布锚定高风险提示来缓解这一问题,并在Omni-MATH-Test等基准测试中取得了改进的结果。

  2. RESEARCH · CL_141489 ·

    新研究解决 AI 代码生成评估与测试问题

    两篇新研究论文探讨了 AI 生成代码评估方面的进展。第一篇 TENET 引入了一个使用测试驱动开发的仓库级代码生成框架,在 RepoCod 和 RepoEval 等基准测试中取得了 Claude Sonnet 4 的高 Pass@1 分数。第二篇 ACES 提出了一种评估代码生成评估测试可靠性的新方法,侧重于测试的一致性以及区分正确和错误代码的能力。

  3. RESEARCH · CL_131293 ·

    新研究质疑 LLM 微调在 Dart 代码反编译中的有效性

    一篇新研究论文探讨了对大型语言模型进行微调以实现 Dart 预编译 (AOT) 二进制文件的神经反编译的有效性。研究发现,微调并未显著提高 pass@k 性能,在某些情况下甚至导致了性能回退。研究人员还观察到指标发散现象,例如 CodeBLEU 和 compile@k 指标有所改善,而 pass@k 指标却下降了,这表明微调可能更侧重于表面相似性而非功能正确性。该论文引入了 HumanEval-Dart 基准测试,并提倡将 pass@…

  4. RESEARCH · CL_109549 ·

    新的SR-PPO方法通过单次采样改进语言模型的强化学习

    研究人员开发了一种名为单次采样近端策略优化(SR-PPO)的新方法,以解决语言模型强化学习中估计token级优势的挑战。该方法使用在每次提示的单次采样上训练的蒙特卡洛Pass@k评论员来改进信用分配并降低计算成本。该方法在HMMT26和AIME24等数学推理基准上显示出稳定的学习和持续的成功率提升。

  5. TOOL · CL_93283 ·

    新研究将RLVR多样性崩溃视为过拟合

    一篇新发表在arXiv上的研究论文探讨了“多样性崩溃”现象,这在强化学习与可验证奖励(RLVR)中出现,RLVR是一种用于增强大型语言模型推理的技术。该论文将此问题视为一种过拟合,即模型过度关注已解决的问题,导致高k Pass@k指标下降。研究人员提出了一种名为贝叶斯边界门控(BBG)的新方法来缓解这一问题,通过将优化从过拟合问题中引导开,并在推理基准测试中显示出改进。

  6. TOOL · CL_56308 ·

    新的RLVR方法解决代码生成冗余问题

    研究人员开发了一种名为冗余感知RLVR的新方法,以改进大型语言模型生成代码的质量。该方法解决了生成代码样本之间过于相似的问题,这会影响性能。通过整合基于代码相似度检测的反冗余奖励,该方法旨在生成更多样化且可执行的代码,其性能通常能与现有技术相媲美或超越。