PulseAugur
实时 07:31:02
实体 Pass@1

Pass@1

PulseAugur coverage of Pass@1 — every cluster mentioning Pass@1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. RESEARCH · CL_247629 ·

    研究:LLM生成的注释如果包含正确解决方案,则能提升代码生成效果

    一篇新发表在arXiv上的研究调查了大型语言模型(LLM)生成的自然语言注释如何影响代码生成性能。研究人员发现,源自成功代码解决方案的注释能显著提高接收模型生成正确代码的能力,平均将pass@1率提高了17.2%。相反,描述失败解决方案或不相关问题的注释则没有益处,甚至会降低性能。研究结果表明,注释的效用在于其传达正确解决方案内容的能力,而不仅仅是其存在或描述意图。

  2. TOOL · CL_233416 ·

    新的LLM框架整合推理和自我批评

    研究人员开发了一个名为Stepwise Think-Critique (STC)的新框架,使单一的大型语言模型能够执行交错的推理和自我批评。与现有模型将这些过程分开不同,STC将批评整合到每个推理步骤中,通过强化学习优化正确性和批评可靠性。与基础模型相比,该方法在数学推理基准上的Pass@1提高了7.2%,并达到了67.4%的步骤级批评F1分数。

  3. RESEARCH · CL_243002 ·

    DART框架使用DAG和区块链实现可信的LLM多智能体协作

    研究人员推出DART,一个旨在增强大型语言模型(LLM)多智能体系统中信任和问责制的新框架。DART利用有向无环图(DAG)结构进行工作流编排,并将其与区块链赋能的去中心化治理相结合。通过实施声誉感知任务分配和动态行为更新,该方法旨在缓解开放环境中不合作或恶意智能体带来的问题。评估表明,DART显著提高了任务成功率,并能有效隔离和遏制恶意智能体行为,其表现优于传统的中心化系统。

  4. TOOL · CL_239622 ·

    新的RL方法GAPO在基准测试中提升了Qwen和Llama的性能

    研究人员推出了一种名为组自适应裁剪策略优化(GAPO)的新方法,旨在通过可验证的奖励来增强强化学习。GAPO根据推广优势自适应地调整裁剪阈值,确保来自低成功率组的有价值学习信号不会被抑制。该方法源于反向KL信任区域的视角,旨在为具有更强学习信号的推广提供更大的更新空间。在Qwen和Llama模型上进行测试,GAPO在数学推理和编码基准测试中的Pass@1和Pass@k指标上,与传统的固定裁剪方法相比,均显示出了一致的改进。

  5. TOOL · CL_205902 ·

    在没有验证的情况下,自我纠错方法未能改善大型语言模型代码生成

    arXiv上的一项新研究调查了大型语言模型(LLMs)在代码生成中自我纠错方法的有效性。研究人员发现,虽然一些不确定性估计技术与正确性之间存在微弱的相关性,但它们并不能可靠地提高在HumanEval和BigCodeBench等基准测试上的性能。只有基于验证的自我纠错(涉及代码执行)显示出准确性的持续提高,这表明仅凭不确定性信号不足以提高代码生成的质量。

  6. RESEARCH · CL_109549 ·

    新的SR-PPO方法通过单次采样改进语言模型的强化学习

    研究人员开发了一种名为单次采样近端策略优化(SR-PPO)的新方法,以解决语言模型强化学习中估计token级优势的挑战。该方法使用在每次提示的单次采样上训练的蒙特卡洛Pass@k评论员来改进信用分配并降低计算成本。该方法在HMMT26和AIME24等数学推理基准上显示出稳定的学习和持续的成功率提升。

  7. RESEARCH · CL_109577 ·

    新的局部分支路由框架增强语言模型推理能力

    研究人员开发了一个名为局部分支路由(LBR)的新框架,以在测试时扩展期间提高语言模型的推理能力。LBR 在 token 级别运行,扩展局部前瞻树并使用轻量级路由器选择最有希望的分支。该方法通过利用候选未来的隐藏状态,实现了更高效且可训练的扩展,在数学推理基准测试中通过提高 Pass@1 和 Pass@32 分数而优于现有方法。

  8. TOOL · CL_93283 ·

    新研究将RLVR多样性崩溃视为过拟合

    一篇新发表在arXiv上的研究论文探讨了“多样性崩溃”现象,这在强化学习与可验证奖励(RLVR)中出现,RLVR是一种用于增强大型语言模型推理的技术。该论文将此问题视为一种过拟合,即模型过度关注已解决的问题,导致高k Pass@k指标下降。研究人员提出了一种名为贝叶斯边界门控(BBG)的新方法来缓解这一问题,通过将优化从过拟合问题中引导开,并在推理基准测试中显示出改进。