研究人员推出了VEX-Bench,这是首个旨在评估大型语言模型(LLM)代理评估软件供应链漏洞可利用性能力的基准测试。该基准包含75个来自GitHub的真实案例,并经过安全专家验证,涵盖Python、Java和Go编程语言。初步评估显示,尽管GPT-5.5和Claude Opus-4.6等模型在二进制漏洞状态分类方面取得了约80%的F1分数,但GPT-5.5在细粒度理由分类方面表现更优,凸显了超越简单可利用性评估的难度。 AI
影响 该基准测试有望加速更复杂的网络安全LLM代理的开发,提高软件供应链漏洞评估的效率。
排序理由 该集群描述了一个用于评估LLM代理在特定任务上表现的新学术基准测试,该测试在一篇研究论文中发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →