研究人员开发了PISmith,一个新颖的强化学习(RL)框架,旨在严格测试大型语言模型(LLMs)中提示注入防御的有效性。该框架训练一个攻击LLM,通过在黑盒设置中优化注入的提示来发现漏洞,在黑盒设置中只能观察到LLM的输出。PISmith结合了自适应熵正则化和动态优势加权,以克服奖励稀疏性等挑战,从而能够从罕见的成功攻击中进行更有效的学习。在13个基准和代理设置上的评估表明,PISmith能够成功突破最先进的防御,其性能优于现有的攻击方法,并对包括GPT-4o mini和GPT-5 nano在内的开源和闭源LLMs都取得了高成功率。 AI
影响 这项研究突显了LLM防御在面对复杂攻击时存在的持续性漏洞,可能影响已部署AI代理的安全性和可信度。
排序理由 详细介绍LLM安全评估新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AgentDojo
- Chenlong Yin
- GPT-4o mini
- GPT-5 nano
- Grpo
- InjecAgent
- PISmith
- prompt injection
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →