CodeContests
PulseAugur coverage of CodeContests — every cluster mentioning CodeContests across labs, papers, and developer communities, ranked by signal.
-
新研究强调了人工智能评估方法的局限性
一篇新论文探讨了机器学习中 pass@k 评估的局限性,特别是在外推到超出收集样本数量的范围时。研究表明,条件二项式模型中的固定 n 成功计数只能识别潜在的每任务成功分布的有限范围。这意味着即使有大量任务,外推到 k > n 的 pass@k 值也无法可靠地识别。该研究使用 Brown 等人的数据集,展示了反事实评估如何导致失败率的显著模糊性。
-
新框架通过故障代码测试提升LLM代码生成能力
研究人员开发了一个名为RobustTests的新框架,通过强化学习来提高大型语言模型(LLM)的代码生成能力。该框架通过合成故障代码来识别逻辑差异,并整合验证器代理来过滤测试用例,从而解决了现有测试用例生成中的局限性。此外,它还包含一个密集奖励函数,以减轻合成测试数据的假阴性。实验表明,使用RobustTests对Qwen3-32B模型进行微调,在LiveCodeBench基准测试中性能提高了3%。
-
MARS系统使用专门的LLM代理来提高竞争性编程性能
研究人员开发了MARS,一个旨在提高大型语言模型在竞争性编程中性能的多智能体中继系统。与使用通用角色的先前多智能体系统不同,MARS采用由检索增强生成支持的主题专家代理(例如,动态规划、图)。这种专门的方法使MARS在使用Gemma 4在CodeContests基准测试上达到了0.624的通过率,相比直接提示有了显著提高,并降低了与其他系统的成本和方差。
-
新的强化学习算法将问题分解,降低大型语言模型成本
研究人员推出了一种新颖的强化学习算法 DecompRL,旨在增强大型语言模型(LLMs)的解决问题能力。DecompRL 不依赖于广泛的采样或多样性优化,而是专注于将复杂问题分解为更小、更易于管理子函数。该算法学习生成和重组这些模块的代码,显著降低了寻找解决方案相关的计算成本。这种方法在 LiveCodeBench 和 CodeContests 等基准测试中表现出色,使大型语言模型能够解决以前无法解决的问题。
-
新的CPPO方法通过探索多种策略来提升代码生成能力
研究人员推出了一种名为协调Pass@K策略优化(CPPO)的新方法,通过同时探索多种不同的算法策略来增强代码生成能力。与抽取独立样本的标准方法不同,CPPO训练一个联合策略,其中规划器提出$K=4$个备选方法,共享求解器尝试为每个方法找到解决方案。这种协调探索在APPS、CodeContests和LiveCodeBench-v6等多个基准测试中,显著提高了pass@K指标。