一个名为 GenIaC-SecBench 的新基准已被开发出来,用于评估大型语言模型生成的基础设施即代码 (IaC) 的安全性。该基准包含 100 个部署场景,并将模型生成的 IaC 的漏洞密度与人类编写的模板基线进行比较。研究发现,虽然所有测试的 LLM 配置都比人类产生了更多的漏洞,但在匹配件大小后,差距缩小了,这表明大小而不是固有的安全缺陷是先前比较中的混淆因素。研究还表明,供应商特定的扩展思维 API 比标准的或提示工程的思维链方法显著提高了安全性,尽管其影响受到令牌使用量的限制。 AI
影响 这项研究强调了在评估 LLM 生成的代码时需要稳健的安全基线,表明当前模型在安全 IaC 编写方面仍落后于人类开发人员。
排序理由 该条目描述了一个新的学术基准和与 LLM 生成的代码安全性相关的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →