pass@k
PulseAugur coverage of pass@k — every cluster mentioning pass@k across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新研究强调了人工智能评估方法的局限性
一篇新论文探讨了机器学习中 pass@k 评估的局限性,特别是在外推到超出收集样本数量的范围时。研究表明,条件二项式模型中的固定 n 成功计数只能识别潜在的每任务成功分布的有限范围。这意味着即使有大量任务,外推到 k > n 的 pass@k 值也无法可靠地识别。该研究使用 Brown 等人的数据集,展示了反事实评估如何导致失败率的显著模糊性。
-
新的 DATPO 方法增强了大型推理模型的推理覆盖范围
研究人员开发了一种新的 DATPO 方法,以提高使用可验证奖励强化学习 (RLVR) 训练的大型推理模型的推理能力。DATPO 通过优化训练 rollout 来解决 RLVR 在扩展内在推理覆盖范围 (pass@k) 方面的局限性。该方法结合了自适应难度树搜索和句子熵引导的分叉,以最大化语义多样性并克服局部化问题,在数学推理基准测试中优于现有方法。
-
新方法提高自然语言到逻辑翻译的准确性
研究人员开发了一种名为分层一致性蒸馏的新方法,以提高将自然语言翻译成逻辑公式的准确性。该方法使用前沿 LLM 生成多个逻辑翻译,然后按语义等价性对它们进行聚类。根据翻译的熵水平,该方法采用多数投票、LLM 作为裁判或统一来选择用于微调较小模型的伪标签。实验表明,在 Pass@K 和逻辑等价相似性指标方面都有显著改进,突显了一致性蒸馏在逻辑翻译中的有效性。
-
新的RL方法GAPO在基准测试中提升了Qwen和Llama的性能
研究人员推出了一种名为组自适应裁剪策略优化(GAPO)的新方法,旨在通过可验证的奖励来增强强化学习。GAPO根据推广优势自适应地调整裁剪阈值,确保来自低成功率组的有价值学习信号不会被抑制。该方法源于反向KL信任区域的视角,旨在为具有更强学习信号的推广提供更大的更新空间。在Qwen和Llama模型上进行测试,GAPO在数学推理和编码基准测试中的Pass@1和Pass@k指标上,与传统的固定裁剪方法相比,均显示出了一致的改进。
-
新的RLVR方法提升LLM推理多样性和性能
研究人员开发了一种新方法,可以在保持大型语言模型(LLM)多样性的同时增强其推理能力。该方法称为具有可验证奖励的强化学习(RLVR),使用更小、更弱的语言模型生成部分推理轨迹。这些轨迹充当提示,促使目标LLM探索更广泛的不同推理路径,并防止过度自信。该技术在数学基准测试中显示出持续的改进,尤其是在k值较大时,且无需额外的监督微调或复杂的奖励设计。
-
AI采样温度理论解释预算依赖的优化
研究人员开发了一个理论框架,以解释为什么 AI 模型(如 Codex)的最佳采样温度通常会随着采样预算的增加而升高。这种现象并非 pass@k 指标本身的代数属性。新理论为这种聚合模式提供了充分条件,并识别出一种在预算增长时有利于低成功率任务的机制。该研究还引入了一个双层相图和一个用于边际温度导数的 Beta(2,k) 核表示,从而深入了解不同的操作模式。
-
新研究识别RLVR中的pass@k反转,并提出缓解策略
一篇新的研究论文探讨了在可验证奖励强化学习(RLVR)中出现的“pass@k反转”现象。当RLVR提高模型单样本准确率,但降低其在需要多次尝试(更高k)的任务上的表现时,就会发生这种情况。该论文认为这是由于证据缺失导致的失败,即在RLVR训练过程中,稀有的正确轨迹会丢失。一种名为“逐问题基准锚定”(PBA)的提议方法,旨在通过优化提示并根据基准模型的分布锚定高风险提示来缓解这一问题,并在Omni-MATH-Test等基准测试中取得了改进的结果。
-
新研究解决 AI 代码生成评估与测试问题
两篇新研究论文探讨了 AI 生成代码评估方面的进展。第一篇 TENET 引入了一个使用测试驱动开发的仓库级代码生成框架,在 RepoCod 和 RepoEval 等基准测试中取得了 Claude Sonnet 4 的高 Pass@1 分数。第二篇 ACES 提出了一种评估代码生成评估测试可靠性的新方法,侧重于测试的一致性以及区分正确和错误代码的能力。
-
新研究质疑 LLM 微调在 Dart 代码反编译中的有效性
一篇新研究论文探讨了对大型语言模型进行微调以实现 Dart 预编译 (AOT) 二进制文件的神经反编译的有效性。研究发现,微调并未显著提高 pass@k 性能,在某些情况下甚至导致了性能回退。研究人员还观察到指标发散现象,例如 CodeBLEU 和 compile@k 指标有所改善,而 pass@k 指标却下降了,这表明微调可能更侧重于表面相似性而非功能正确性。该论文引入了 HumanEval-Dart 基准测试,并提倡将 pass@…
-
新的SR-PPO方法通过单次采样改进语言模型的强化学习
研究人员开发了一种名为单次采样近端策略优化(SR-PPO)的新方法,以解决语言模型强化学习中估计token级优势的挑战。该方法使用在每次提示的单次采样上训练的蒙特卡洛Pass@k评论员来改进信用分配并降低计算成本。该方法在HMMT26和AIME24等数学推理基准上显示出稳定的学习和持续的成功率提升。
-
新研究将RLVR多样性崩溃视为过拟合
一篇新发表在arXiv上的研究论文探讨了“多样性崩溃”现象,这在强化学习与可验证奖励(RLVR)中出现,RLVR是一种用于增强大型语言模型推理的技术。该论文将此问题视为一种过拟合,即模型过度关注已解决的问题,导致高k Pass@k指标下降。研究人员提出了一种名为贝叶斯边界门控(BBG)的新方法来缓解这一问题,通过将优化从过拟合问题中引导开,并在推理基准测试中显示出改进。
-
新的RLVR方法解决代码生成冗余问题
研究人员开发了一种名为冗余感知RLVR的新方法,以改进大型语言模型生成代码的质量。该方法解决了生成代码样本之间过于相似的问题,这会影响性能。通过整合基于代码相似度检测的反冗余奖励,该方法旨在生成更多样化且可执行的代码,其性能通常能与现有技术相媲美或超越。