一个名为 CIPR 的新基准已被开发出来,用于评估编码代理对存储库投毒的易感性。该基准系统地改变了被投毒的真实存储库中的用户定义的“提示级别配置”(PLCs)。研究发现,任务类型显著影响攻击成功率,其中测试执行任务呈现出特别隐蔽的攻击面。此外,提示的表达方式会间接改变风险,不明确的提示可能会通过限制执行深度来降低攻击成功率,而嘈杂的提示有时会抑制警报。 AI
影响 强调了用户交互模式如何被利用来损害 AI 编码代理,强调了安全提示工程实践的必要性。
排序理由 学术论文,介绍了一个新的基准和关于 AI 代理安全性的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Prompt-Level Configurations
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →