PulseAugur
实时 10:58:39
English(EN) A Comprehensive Evaluation of Code Language Models for Security Patch Detection

研究发现代码模型会遗漏80%的安全修复 · arXiv研究

一项新近发表在arXiv上的研究评估了代码语言模型在检测安全补丁方面的有效性,发现即使是大型模型也会遗漏相当一部分漏洞修复。该研究强调了数据质量和评估方法方面的问题,并指出当前模型在0.5%的误报率下未能识别至少80%的修复。作者建议改进评估实践,并发布了一个统一的框架和数据集以辅助未来的研究。 AI

影响 强调了当前代码语言模型在安全任务中的局限性,表明需要改进评估和模型开发。

排序理由 发表在arXiv上的研究论文,详细介绍了对代码语言模型的评估。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现代码模型会遗漏80%的安全修复 · arXiv研究

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Nils Loose, Joseph Bienh\"uls, Kristoffer Hempel, Felix M\"achtle, Thomas Eisenbarth ·

    A Comprehensive Evaluation of Code Language Models for Security Patch Detection

    arXiv:2605.13138v2 Announce Type: replace-cross Abstract: Automated detection of vulnerability-fixing commits (\vfcs) is critical for timely security patch deployment, as advisory databases lag patch releases by a median of 25 days and many fixes never receive advisories. Code la…