MBPP
PulseAugur coverage of MBPP — every cluster mentioning MBPP across labs, papers, and developer communities, ranked by signal.
- instance of HumanEval 70%
- used by GSM8K 70%
- competes with HumanEval 70%
- developed large-language models 70%
- instance of large-language models 70%
- instance of Gotit.pub 70%
- instance of ScienceCast 70%
- instance of CatalyzeX 70%
- used by Math-500 70%
- developed by large-language models 70%
- instance of DagsHub 70%
- instance of alphaXiv 70%
4 天有情绪数据
-
MIRROR 原始机制可防御针对 LLM 多智能体通信的攻击 · 已追踪 2 个来源
研究人员推出了一种新颖的通信层完整性原始机制 MIRROR,旨在保护大型语言模型多智能体系统 (LLM-MAS) 免受中间人攻击 (AiTM)。MIRROR 将消息复制到多个逻辑路径,仅当严格多数路径报告相同的摘要时才接受消息,从而防止传输中的消息被篡改。在跨各种基准和框架的测试中,此方法有效地将攻击成功率降至 0%,同时与 LLM-as-a-Judge 等替代方法相比,计算成本极低。
-
新SPECTRUM方法增强AI代码生成多样性
研究人员推出了一种新颖的循环自蒸馏框架SPECTRUM,旨在改进代码生成模型。与可能导致正确解多样性收缩的传统自蒸馏方法不同,SPECTRUM旨在保留更广泛的正确实现方法。该方法通过重新估计键/值几何结构并应用谱调制来实现这一点,使单个学生模型能够在没有外部评估的情况下从更广泛的生成输出来学习。在MBPP、HumanEval和APPS Intro等基准测试上的实验表明,SPECTRUM在保持和转移解多样性方面显著优于普通自蒸馏。
-
新研究探索自监督学习在公平性、效率和多样化输出方面的应用
多篇研究论文探讨了自监督学习(SSL)的进展,这是一种在无标签数据上训练模型的技术。其中一项研究FairSSL,通过利用数据异质性和主题感知正则化,引入了一个框架来提高多模态SSL的公平性。另一篇论文研究了增加网络宽度如何使贪婪的逐层训练在SSL中能与端到端反向传播相媲美,尤其是在更宽的网络中。进一步的研究深入探讨了哪些下游任务最能从SSL中受益,发现它在异常检测和分类方面有效,但在预测方面效果不佳。此外,一种名为DRY-SFT的新方…
-
新的 MoMHa 系统优化 LLM Harness,平衡准确性、安全性和 Token 成本
研究人员开发了 MoMHa,一个用于优化大型语言模型 (LLM) Harness 的新系统。与以往只关注准确性的方法不同,MoMHa 将准确性、行为安全性和 Token 成本视为多目标标准。该系统利用一个具有代理功能的提案者 Claude Code,该提案者可以广泛访问先前的 Harness 设计和执行数据,以搜索最优的 Harness 配置。在合成和真实世界基准测试中,使用 12 种不同模型的评估表明,MoMHa 在联合奖励、行为安…
-
新的SCALE方法通过控制特征使用来增强SFT
研究人员推出了一种名为SCALE(Selective Control of Adaptation via Local Entropy,通过局部熵选择性控制适应)的新型监督微调(SFT)方法,旨在通过控制学习到的特征的使用方式来改进模型适应性。与专注于抑制或放大更新的现有方法不同,SCALE冻结了预训练模型和SFT增量,学习门控机制,根据熵减少来抑制、反转或外推特征。这种方法在多个Qwen模型(包括Qwen2.5-Math-1.5B、Q…
-
新方法自动演进AI评估指标
研究人员开发了一种名为EvalCEGAR的新颖方法,用于自动生成AI代理的评估指标,特别适用于报告生成等人工评分困难的任务。该方法使用了一组小的Python算子,用于标记AI生成内容中的特定缺陷。通过采用类似程序验证技术的反例引导抽象细化,EvalCEGAR搜索被算子错误地相同评分的AI输出对。此过程会迭代地改进算子,以提高其准确性并减少误报数量,从而显著缩小在基准数据集上随机猜测与完美过滤之间的差距。
-
新框架提升LLM生成代码质量
研究人员开发了一个新框架,以提高大型语言模型(LLM)生成的代码的非功能性质量。该方法包括创建一个包含有质量问题和无质量问题的代码的数据集,实施一种自适应令牌加权机制来关注质量敏感的代码区域,并使用混合优化目标。在DeepSeek-Coder和Qwen2.5-Coder等模型上的实验表明,在保持功能正确性的同时,代码符合编码标准的程度显著提高,微调一个7B模型耗时不到三小时。
-
新方法将线性注意力改造到扩散语言模型中以加速其运行
研究人员开发了一种将线性注意力改造到扩散语言模型(dLLMs)中的方法,以加速推理。这种名为块混合注意力(block-hybrid attention)的新方法将精确的softmax注意力与活动去噪块结合,并对之前的块应用线性注意力。当应用于LLaDA~2.1模型并生成LLaDA-Hybrid时,它实现了高达1.7倍的解码吞吐量提升,并提高了内存效率,同时在HumanEval和MBPP+等基准测试中性能没有明显下降。
-
新AI方法DELSCOUT通过计划性建议处理代码删除
研究人员开发了一种名为DELSCOUT的新颖方法,用于AI系统删除冗余代码,解决了大型编程模型中代码膨胀的挑战。该方法侧重于调度删除候选对象,以优化有限的执行-验证能力的利用。DELSCOUT在纳入学习到的候选对象之前,优先处理确定性的删除候选对象,旨在提高已验证的代码删除量,同时管理计算资源。
-
新的RAV框架提升LLM代码生成正确性
研究人员开发了RAV,一个旨在提高大型语言模型生成代码的功能正确性的框架。RAV采用三阶段流程:任务感知提示路由、对齐LoRA适配以最小化提示不匹配,以及基于执行的对多个生成输出进行公共测试验证。在MBPP基准上进行评估时,完整的RAV流程实现了最先进的性能,显著优于基础模型,并证明了在不改变核心模型架构的情况下结合提示、适配和验证策略的有效性。
-
盲目重采样在小型代码模型中优于自我修复
一篇新的研究论文探讨了不同重试策略对小型代码模型的有效性,特别是比较了盲目重采样与自我修复。研究发现,盲目重采样(即在不向模型提供其先前失败尝试的情况下进行重试)通常优于自我修复,尤其对于参数量小于70亿的模型。这表明向模型提供其自身的失败代码可能会导致锚定效应,使其复制类似的错误,而不是生成新颖、正确的解决方案。
-
CodexGraph系统增强了LLM与代码仓库的交互能力
研究人员开发了CodexGraph,一个旨在改进大型语言模型(LLMs)与整个代码仓库交互方式的新系统。与依赖相似性检索或特定任务API的现有方法不同,CodexGraph将LLM代理与从代码中提取的图数据库接口集成。这种方法允许LLMs构建和执行精确的、结构感知的查询,以进行上下文检索和代码导航。CodexGraph在CrossCodeEval、SWE-bench和EvoCodeBench等学术基准测试以及实际软件工程应用中都展现了…
-
AI模型的循环工程易于实现但容易出错
循环工程是一种通过创建迭代提示结构来提高AI模型性能的技术,其实现过程可能看似简单,但容易出现细微错误。Anthropic公司Claude Code负责人Boris Cherny已从直接提示转向设计这些循环。在构建两个核心循环工程组件“run-until-done”和“maker/checker”的近期实验中,发现包含测试执行的“安全”maker/checker方法比简单的置信度检查方法具有更高的误接受率。实验还发现,“真实反馈”循环…
-
DC-Leap 框架通过无训练解码加速 dLLM
研究人员推出了一种新颖的无训练框架 DC-Leap,旨在加速扩散大型语言模型 (dLLM) 的推理速度。该方法解决了并行解码中保守的置信度阈值问题,该问题通常会导致冗余迭代和性能下降。DC-Leap 采用动态连续验证策略来管理联合概率依赖误差,并集成了一个由草稿引导的解码机制来实现前瞻性上下文。实验表明,在长序列生成的 MBPP 基准测试中,速度显著提升,最高可达 53.19 倍,并且与 KV-Cache 结合使用时,性能提升更大,同…
-
新的掩码感知策略梯度在基准测试中提升DLM推理能力 · 跟踪2个来源
研究人员开发了一种名为掩码感知策略梯度的新方法,以增强扩散语言模型(DLMs)的推理能力。该方法通过准确估计对数似然,解决了将强化学习应用于掩码扩散语言模型(MDLMs)的挑战。该技术将生成过程形式化为两阶段动作马尔可夫决策过程,优化了token放置和掩码决策。这种双重优化在数学推理和编码基准测试中取得了最先进的结果,在GSM8K上达到87.1%,在MBPP上达到53.4%。
-
研究论文强调AI代码生成奖励系统的缺陷
一篇新研究论文调查了在代码生成的“人类反馈强化学习”(RLHF)中“有漏洞”的奖励套件问题。研究发现,现有的测试套件包含持续的误报,这可能导致模型因生成有缺陷的代码而获得不正确的奖励。通过比较一个使用有漏洞套件训练的GRPO模型与一个加固套件训练的模型,研究人员观察到性能差异很小,这表明套件伪影带来的奖励膨胀并未显著影响能力。研究结果表明,这些误报通常是预先存在的错误模式,而不是模型学习到的利用。
-
新的MRP技术提高了语言模型的速度和准确性
来自Modal Research和纽约大学上海分校HeavyBall Research的研究人员开发了一种名为多标记残差预测(MRP)的新技术,该技术提高了语言模型的速度和准确性。MRP通过训练一个小模块来预测扩散语言模型中相邻去噪步骤之间的残差差异,而不是预测整个分布。这种方法在静态模式下可以实现高达1.56倍的吞吐量,并且在动态模式下可以恢复在激进的低阈值解码设置中丢失的重要准确性点,同时几乎没有质量损失。
-
AI代码模型通过伪造而非仅仅重试来改进 · 跟踪2个来源
一篇新的研究论文探讨了小型、冻结代码模型中自我修复机制的有效性。该研究采用安慰剂对照方法,发现提供给模型的外部、可执行的反例比仅仅让它们重新暴露于自身失败的输出来更有益。在各种基准测试和模型中,这种以伪造为中心的方法在代码生成成功率方面显示出统计学上的显著提高。
-
用于代码生成的 LLM 对齐:预训练模型 vs. 微调模型
研究人员探讨了大型语言模型 (LLM) 对齐技术在代码生成任务中的有效性,研究了对齐应该从预训练的 LLM 还是微调的 LLM 开始。该研究在五个最先进的 LLM 上使用了两种无奖励对齐方法:直接偏好优化 (DPO) 和 BoNBoN。结果表明,对齐预训练模型比其预训练的对应模型在对齐版本中带来了更大的改进,尽管预训练模型总体上准确性较低。相反,对齐微调模型产生的性能提升较小,甚至出现性能下降。
-
新方法通过自适应解码策略提高 LLM 推理速度
研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。