研究人员推出SRE-Bench,这是一个新颖的基准,旨在评估AI代理在网络安全领域的逆向工程能力。该基准的独特性在于其真实的规模以及防止数据污染的严格方法,确保AI模型必须真正分析二进制文件,而不是依赖于记忆的源代码。使用SRE-Bench进行的评估显示,包括GPT-5.6-sol在内的当前前沿AI模型在逆向工程任务方面仍然面临重大挑战,这突显了在Agentic网络安全领域未来发展中的关键领域。 AI
影响 突显了AI在源代码分析和二进制分析能力之间的差距,表明Agentic网络安全领域需要进一步发展。
排序理由 该项目是一篇介绍AI能力新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →