PulseAugur
实时 06:37:23
实体 MBPP

MBPP

PulseAugur coverage of MBPP — every cluster mentioning MBPP across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 30
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 28
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/2 页 · 共 30 条
  1. TOOL · CL_210402 ·

    新方法自动演进AI评估指标

    研究人员开发了一种名为EvalCEGAR的新颖方法,用于自动生成AI代理的评估指标,特别适用于报告生成等人工评分困难的任务。该方法使用了一组小的Python算子,用于标记AI生成内容中的特定缺陷。通过采用类似程序验证技术的反例引导抽象细化,EvalCEGAR搜索被算子错误地相同评分的AI输出对。此过程会迭代地改进算子,以提高其准确性并减少误报数量,从而显著缩小在基准数据集上随机猜测与完美过滤之间的差距。

  2. TOOL · CL_206234 ·

    新框架提升LLM生成代码质量

    研究人员开发了一个新框架,以提高大型语言模型(LLM)生成的代码的非功能性质量。该方法包括创建一个包含有质量问题和无质量问题的代码的数据集,实施一种自适应令牌加权机制来关注质量敏感的代码区域,并使用混合优化目标。在DeepSeek-Coder和Qwen2.5-Coder等模型上的实验表明,在保持功能正确性的同时,代码符合编码标准的程度显著提高,微调一个7B模型耗时不到三小时。

  3. TOOL · CL_191323 ·

    新方法将线性注意力改造到扩散语言模型中以加速其运行

    研究人员开发了一种将线性注意力改造到扩散语言模型(dLLMs)中的方法,以加速推理。这种名为块混合注意力(block-hybrid attention)的新方法将精确的softmax注意力与活动去噪块结合,并对之前的块应用线性注意力。当应用于LLaDA~2.1模型并生成LLaDA-Hybrid时,它实现了高达1.7倍的解码吞吐量提升,并提高了内存效率,同时在HumanEval和MBPP+等基准测试中性能没有明显下降。

  4. TOOL · CL_185285 ·

    新AI方法DELSCOUT通过计划性建议处理代码删除

    研究人员开发了一种名为DELSCOUT的新颖方法,用于AI系统删除冗余代码,解决了大型编程模型中代码膨胀的挑战。该方法侧重于调度删除候选对象,以优化有限的执行-验证能力的利用。DELSCOUT在纳入学习到的候选对象之前,优先处理确定性的删除候选对象,旨在提高已验证的代码删除量,同时管理计算资源。

  5. TOOL · CL_183169 ·

    新的RAV框架提升LLM代码生成正确性

    研究人员开发了RAV,一个旨在提高大型语言模型生成代码的功能正确性的框架。RAV采用三阶段流程:任务感知提示路由、对齐LoRA适配以最小化提示不匹配,以及基于执行的对多个生成输出进行公共测试验证。在MBPP基准上进行评估时,完整的RAV流程实现了最先进的性能,显著优于基础模型,并证明了在不改变核心模型架构的情况下结合提示、适配和验证策略的有效性。

  6. TOOL · CL_171930 ·

    盲目重采样在小型代码模型中优于自我修复

    一篇新的研究论文探讨了不同重试策略对小型代码模型的有效性,特别是比较了盲目重采样与自我修复。研究发现,盲目重采样(即在不向模型提供其先前失败尝试的情况下进行重试)通常优于自我修复,尤其对于参数量小于70亿的模型。这表明向模型提供其自身的失败代码可能会导致锚定效应,使其复制类似的错误,而不是生成新颖、正确的解决方案。

  7. TOOL · CL_167466 ·

    CodexGraph系统增强了LLM与代码仓库的交互能力

    研究人员开发了CodexGraph,一个旨在改进大型语言模型(LLMs)与整个代码仓库交互方式的新系统。与依赖相似性检索或特定任务API的现有方法不同,CodexGraph将LLM代理与从代码中提取的图数据库接口集成。这种方法允许LLMs构建和执行精确的、结构感知的查询,以进行上下文检索和代码导航。CodexGraph在CrossCodeEval、SWE-bench和EvoCodeBench等学术基准测试以及实际软件工程应用中都展现了…

  8. COMMENTARY · CL_165265 ·

    AI模型的循环工程易于实现但容易出错

    循环工程是一种通过创建迭代提示结构来提高AI模型性能的技术,其实现过程可能看似简单,但容易出现细微错误。Anthropic公司Claude Code负责人Boris Cherny已从直接提示转向设计这些循环。在构建两个核心循环工程组件“run-until-done”和“maker/checker”的近期实验中,发现包含测试执行的“安全”maker/checker方法比简单的置信度检查方法具有更高的误接受率。实验还发现,“真实反馈”循环…

  9. TOOL · CL_160647 ·

    DC-Leap 框架通过无训练解码加速 dLLM

    研究人员推出了一种新颖的无训练框架 DC-Leap,旨在加速扩散大型语言模型 (dLLM) 的推理速度。该方法解决了并行解码中保守的置信度阈值问题,该问题通常会导致冗余迭代和性能下降。DC-Leap 采用动态连续验证策略来管理联合概率依赖误差,并集成了一个由草稿引导的解码机制来实现前瞻性上下文。实验表明,在长序列生成的 MBPP 基准测试中,速度显著提升,最高可达 53.19 倍,并且与 KV-Cache 结合使用时,性能提升更大,同…

  10. RESEARCH · CL_147419 ·

    新的掩码感知策略梯度在基准测试中提升DLM推理能力 · 跟踪2个来源

    研究人员开发了一种名为掩码感知策略梯度的新方法,以增强扩散语言模型(DLMs)的推理能力。该方法通过准确估计对数似然,解决了将强化学习应用于掩码扩散语言模型(MDLMs)的挑战。该技术将生成过程形式化为两阶段动作马尔可夫决策过程,优化了token放置和掩码决策。这种双重优化在数学推理和编码基准测试中取得了最先进的结果,在GSM8K上达到87.1%,在MBPP上达到53.4%。

  11. RESEARCH · CL_141167 ·

    研究论文强调AI代码生成奖励系统的缺陷

    一篇新研究论文调查了在代码生成的“人类反馈强化学习”(RLHF)中“有漏洞”的奖励套件问题。研究发现,现有的测试套件包含持续的误报,这可能导致模型因生成有缺陷的代码而获得不正确的奖励。通过比较一个使用有漏洞套件训练的GRPO模型与一个加固套件训练的模型,研究人员观察到性能差异很小,这表明套件伪影带来的奖励膨胀并未显著影响能力。研究结果表明,这些误报通常是预先存在的错误模式,而不是模型学习到的利用。

  12. TOOL · CL_120339 ·

    新的MRP技术提高了语言模型的速度和准确性

    来自Modal Research和纽约大学上海分校HeavyBall Research的研究人员开发了一种名为多标记残差预测(MRP)的新技术,该技术提高了语言模型的速度和准确性。MRP通过训练一个小模块来预测扩散语言模型中相邻去噪步骤之间的残差差异,而不是预测整个分布。这种方法在静态模式下可以实现高达1.56倍的吞吐量,并且在动态模式下可以恢复在激进的低阈值解码设置中丢失的重要准确性点,同时几乎没有质量损失。

  13. RESEARCH · CL_119629 ·

    AI代码模型通过伪造而非仅仅重试来改进 · 跟踪2个来源

    一篇新的研究论文探讨了小型、冻结代码模型中自我修复机制的有效性。该研究采用安慰剂对照方法,发现提供给模型的外部、可执行的反例比仅仅让它们重新暴露于自身失败的输出来更有益。在各种基准测试和模型中,这种以伪造为中心的方​​法在代码生成成功率方面显示出统计学上的显著提高。

  14. TOOL · CL_117600 ·

    用于代码生成的 LLM 对齐:预训练模型 vs. 微调模型

    研究人员探讨了大型语言模型 (LLM) 对齐技术在代码生成任务中的有效性,研究了对齐应该从预训练的 LLM 还是微调的 LLM 开始。该研究在五个最先进的 LLM 上使用了两种无奖励对齐方法:直接偏好优化 (DPO) 和 BoNBoN。结果表明,对齐预训练模型比其预训练的对应模型在对齐版本中带来了更大的改进,尽管预训练模型总体上准确性较低。相反,对齐微调模型产生的性能提升较小,甚至出现性能下降。

  15. RESEARCH · CL_115628 ·

    新方法通过自适应解码策略提高 LLM 推理速度

    研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。

  16. TOOL · CL_98129 ·

    New signature filtering method boosts LLM watermark detection accuracy

    研究人员开发了一种名为签名过滤的新方法,以改进大型语言模型中统计水印的检测。该技术在不改变嵌入或生成过程的情况下增强了现有的水印检测。通过识别和移除可能干扰检测的特定“签名”标记,该方法显著提高了准确性,尤其是在信号较弱或文本重复的情况下。该方法在各种大型语言模型和数据集上都表现出高检测率,即使在句子打乱和标记扰动等挑战性条件下也是如此。

  17. RESEARCH · CL_93587 ·

    研究发现大多数事后验证算子未能提高冻结代码模型的准确性

    一篇新发表在arXiv上的研究调查了针对小型、冻结代码的事后验证算子,发现大多数算子与Best-of-N等标准方法相比,并不能提高准确性。研究强调了“覆盖墙”和“能力剪刀”是关键限制。然而,“表达层恢复”方法通过恢复标准提取器丢弃的正确程序显示出希望,提高了DeepSeek-Coder-1.3B在HumanEval+等基准测试上的性能。

  18. TOOL · CL_62660 ·

    Qwen2.5-Coder 和 DeepSeek-Coder V2 领跑本地编码LLM竞赛

    对于拥有8GB显存的用户来说,Qwen2.5-Coder 7B模型是编码任务的首选,它提供了令人印象深刻的基准分数和一个大的上下文窗口。拥有12-16GB显存的用户则面临权衡:是选择像Qwen2.5-Coder 14B-Instruct这样的密集型14B参数模型,它提供更快的推理速度;还是选择DeepSeek-Coder-V2-Lite,一个每个token激活参数较少的混合专家模型,但由于专业专家可能具有更高的质量。

  19. TOOL · CL_58838 ·

    新的BrahmicTokenizer-131K提高了印度语言分词效率

    研究人员开发了BrahmicTokenizer-131K,这是一种旨在提高印度语言效率的新分词器,同时保持在英语和代码上的性能。与Mistral-Nemo Tekken/Sarvam-m等现有模型相比,该分词器在印度语言预训练文本上的分词数量减少了26.7%,在奥里亚语等语言上取得了显著的进步。BrahmicTokenizer-131K是OpenAI的o200k_base的即插即用替代品,在英语分词能力上具有竞争力,并在编码和数学基准…

  20. TOOL · CL_56429 ·

    新的“Poison-with-Style”攻击以微妙的触发器为目标,攻击代码LLM

    研究人员开发了一种名为Poison-with-Style (PwS) 的新型数据投毒攻击,该攻击以代码大型语言模型 (CLLM) 为目标。该攻击巧妙地将触发代码风格嵌入开发者的提示中,导致CLLM在没有明确触发词的情况下生成易受攻击的代码。PwS在对抗现有防御措施方面表现出鲁棒性,并在生成特定漏洞(如CWE-20)方面取得了高成功率,同时对标准代码补全基准测试的性能影响最小。