研究人员推出了Vulnerability Localization Benchmark (VLoc Bench),这是一个新的数据集,旨在评估AI代理在软件仓库中识别与安全漏洞相关的特定代码位置的能力。该基准包含290个仓库和147个通用弱点枚举 (CWE) 类别的500个真实世界漏洞,测试代理精确定位受影响文件的能力。对27个语言模型和4个静态分析工具的初步评估显示,仓库规模的漏洞定位仍然是一个重大挑战,表现最好的系统仅达到0.229的文件F1分数。 AI
影响 为AI安全代理建立了新的评估标准,突出了代码级漏洞识别方面的现有局限性。
排序理由 该集群描述了一个用于评估AI代理在特定任务上的新学术基准,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Common Weakness Enumeration
- DagsHub
- File F1
- Hugging Face
- VLoc Bench
- Vulnerability Localization Benchmark
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →