研究人员推出VICBench,一个旨在评估代码漏洞检测工具的新基准测试。该基准测试包含100个经过验证的、在Python、Java和C++的88个项目中引入漏洞的提交(VICs),涵盖48种常见弱点枚举(CWE)类型。VICBench的特点是复杂的、真实的修复及其对应的VICs,其规模远大于先前的工作。使用VICBench进行的评估表明,V-SZZ和LLM4SZZ等当前最先进的算法仅获得中等F1分数,凸显了在漏洞检测中持续需要人工参与。 AI
影响 该基准测试将能够更全面地评估AI驱动的代码漏洞检测,可能加速开发更有效的安全工具。
排序理由 该条目描述了一篇介绍用于评估代码漏洞检测中AI模型的基准测试的新学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →