一个名为 Porting Benchmark 的新基准已被开发出来,用于评估自动化安全补丁回溯工具在各种场景下的有效性。该基准包含 1,234 个案例,揭示出当前工具在泛化能力方面存在困难,在处理复杂补丁时性能会显著下降。研究确定了关键的失败类别,并为未来工具开发指明了方向,强调标准的基准分数可能无法完全反映真实的修复能力。 AI
影响 强调了对更强大的基于 LLM 的自动化安全补丁回溯工具的需求,影响软件安全实践。
排序理由 介绍新基准和对现有工具进行评估的研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →