实体
CVE-Bench
CVE-Bench
PulseAugur coverage of CVE-Bench — every cluster mentioning CVE-Bench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
AI代理彻底改变安全测试,发现数千个漏洞
人工智能驱动的代理正在彻底改变安全测试,从辅助工具转变为自主猎手。XBOW等系统已登上赏金漏洞排行榜榜首,以仅为人类专家一小部分成本的代价发现了数千个漏洞。虽然人工智能在发现已知甚至零日漏洞方面表现出色,但在复杂、真实世界的环境中证明可利用性以及与人工智能驱动的对手快速工程利用相比的修复速度方面仍存在挑战。这一趋势表明利用时间正在缩短,人工智能代理能够在几分钟内将CVE转化为可用漏洞,从而需要更快、更自动化的修复周期。
-
Fireworks AI 强调 FailSafe SWARM 的 CVE-Bench 第一名得分
Fireworks AI 的推理基础设施平台强调了 FailSafe SWARM 在 CVE-Bench 基准测试中取得第一名的成就。据报道,FailSafe SWARM 的得分率为 62.5%,几乎是次高竞争对手的两倍。
-
LLM 代理难以修复安全漏洞,留下未修复的漏洞
开发了一个新的基准 CVE-Bench,用于评估 LLM 代理修复 Python 项目中安全漏洞的能力。在 18 个项目和 20 个真实 CVE 中,表现最好的模型在完全修复漏洞方面的成功率仅为 50%。值得注意的是,即使模型似乎修复了错误并通过了回归测试,漏洞通常仍然存在,这凸显了一种危险的故障模式,即在没有隐藏的安全测试的情况下,修复与正确修复无法区分。