BigCodeBench
PulseAugur coverage of BigCodeBench — every cluster mentioning BigCodeBench across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
论文:LLM 隐藏状态可预测代码正确性
一项新的论文探讨了使用内省不确定性估计 (IUE) 来衡量大型语言模型 (LLM) 生成代码的正确性。研究表明,LLM 隐藏状态可以在响应和代码行级别上有效指示功能代码的正确性,这对于实际软件工程至关重要。虽然静态单标记探测最有效,但在不同任务和领域上的泛化性有所下降。研究还发现,代码行级别的预测比响应级别的估计更具挑战性,尽管条件定位设置在识别故障点方面显示出有效性。
-
研究发现:大型语言模型会过度编辑代码
一篇新的研究论文探讨了在代码修复中使用大型语言模型(LLMs)时出现的“过度编辑”问题。研究发现,即使是像GPT-5.5这样先进的模型,也倾向于进行不必要的较大编辑,从而增加了复杂性并降低了可审查性。研究人员开发了一个使用BigCodeBench的框架来评估这一点,并证明了“保留指令”可以显著提高编辑保真度。研究结果表明,虽然监督微调可能会过拟合特定的损坏模式,但强化学习在学习最小化和忠实的代码编辑方面提供了更好的权衡。
-
新的记忆系统APEX-EM提升LLM智能体性能
研究人员开发了APEX-EM,一个新颖的非参数记忆系统,旨在增强大型语言模型智能体的能力。该系统将完整的程序-情景轨迹存储在结构化知识图中,使智能体能够回忆和重用先前遇到的任务的解决方案,从而避免冗余推理。APEX-EM采用计划-检索-生成-迭代-摄入(Plan-Retrieve-Generate-Iterate-Ingest)工作流程来管理和存储成功与失败的经验。在使用GPT-4o和Opus等模型在BigCodeBench和Life…
-
新框架STEP-KTODER通过函数级反馈优化代码生成
研究人员推出了一种名为STEP-KTODER的新型框架,旨在通过函数级过程监督来增强代码生成模型。该方法将“步骤”定义为分解程序中的模块级函数,并利用自动生成的单元测试来分配二进制正确性标签。通过结合函数级监督和结果级反馈,STEP-KTODER旨在改进现有的方法,如直接偏好优化(DPO)和仅结果的KTO。在HumanEval(+)和MBPP(+)等基准上的评估证明了STEP-KTODER的有效性,并强调了基于执行的标签相对于会降低性…
-
在没有验证的情况下,自我纠错方法未能改善大型语言模型代码生成
arXiv上的一项新研究调查了大型语言模型(LLMs)在代码生成中自我纠错方法的有效性。研究人员发现,虽然一些不确定性估计技术与正确性之间存在微弱的相关性,但它们并不能可靠地提高在HumanEval和BigCodeBench等基准测试上的性能。只有基于验证的自我纠错(涉及代码执行)显示出准确性的持续提高,这表明仅凭不确定性信号不足以提高代码生成的质量。
-
新指标和基准推动AI代码质量评估
研究人员开发了FASE,一个用于评估多智能体AI系统中代码质量的新指标。FASE通过分析代码不相似性来近似评估功能正确性,与现有方法相比速度显著提升。另外,引入了一个名为CoQuIR的新基准,用于评估代码检索系统在功能相关性之外的维度,包括正确性、效率、安全性和可维护性。CoQuIR包含11种语言的42,000多个查询的注释,并指出当前的检索模型常常无法区分高质量和低质量代码。
-
FLARE框架通过细粒度错误检测改进LLM代码生成
研究人员开发了FLARE,一个旨在提高大型语言模型生成代码准确性的新框架。FLARE利用一个轻量级的诊断模型来精确定位可能包含错误的具体代码行,提供比现有方法更精确的反馈。实验表明,FLARE的性能显著优于当前基线,根据搜索策略的不同,改进幅度在1.72%到8.50%之间。
-
ReCode框架通过奖励推理过程来增强AI代码生成
研究人员开发了ReCode,一个新颖的强化学习框架,旨在通过关注推理过程来改进代码生成。该框架使用对比推理过程奖励学习(CRPL)在合成的推理变体上训练奖励模型,并使用一致性门控GRPO(CG-GRPO)来整合这些奖励,同时通过执行结果缓解奖励攻击。ReCode应用于一个7B模型时,比其基础版本提高了16.1%,并在各种基准测试上取得了与GPT-4-Turbo相当的性能。