研究人员开发了 HoF-Bench,这是一个旨在评估 AI 模型在不依赖前沿模型的情况下发现真实世界软件漏洞的能力的新基准。该基准由来自 OpenSSL 和 curl 等成熟开源项目的 95 个 AI 发现的 CVE 组成。在测试中,一个经过精心设计的、最小化的基于 LLM 的分析器在严格条件下成功重新发现了其中 68% 的漏洞,而研究中没有使用前沿模型进行检测。HoF-Bench 旨在为比较漏洞扫描器和评估其可靠性提供一种标准化方法,特别指出 C 编程语言代码中的漏洞对所测试的模型来说更具挑战性。 AI
影响 该基准可以加速开发更可靠的、由 AI 驱动的安全工具,用于识别软件漏洞。
排序理由 该集群描述了一个用于评估 AI 模型在特定研究任务(发现软件漏洞)上的新基准,该基准基于一篇学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →