一项新近发表在arXiv上的研究评估了代码语言模型在检测安全补丁方面的有效性,发现即使是大型模型也会遗漏相当一部分漏洞修复。该研究强调了数据质量和评估方法方面的问题,并指出当前模型在0.5%的误报率下未能识别至少80%的修复。作者建议改进评估实践,并发布了一个统一的框架和数据集以辅助未来的研究。 AI
影响 强调了当前代码语言模型在安全任务中的局限性,表明需要改进评估和模型开发。
排序理由 发表在arXiv上的研究论文,详细介绍了对代码语言模型的评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →