研究人员开发了一种使用激活探针的方法,用于检测AI模型在简单提示时可能忽略的代码安全漏洞。通过分析在有漏洞和已修复的Python代码上训练的开放权重AI模型的内部激活,一个线性探针可以在多个模型中以61-67%的准确率识别出有漏洞的函数。这种方法比直接提示模型更有效,即使使用了链式思考推理,后者也常常无法区分有漏洞和已修复的代码。 AI
影响 这项研究可能带来更强大的AI代码审查工具,从而提高AI生成代码的安全性。
排序理由 详细介绍AI安全新研究方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →