一篇新的研究论文引入了持久语义实体(PSE)的概念,用于描述工具增强的LLM代理中的隐式状态。这些实体可以在会话之间持久存在并在代理之间传播,但标准调试方法几乎无法检测到它们。研究发现,所有经过测试的模型,参数量从1.5B到1T不等,都容易受到PSE的影响,其中名称绑定是主要机制。由于许多模型中存在持久性且缺乏自我纠正能力,偏好和指令污染被确定为特别令人担忧的攻击面。 AI
影响 突出了LLM代理中与持久、隐藏状态相关的新攻击面,可能影响代理的可靠性和安全性。
排序理由 学术论文,介绍了一种用于LLM代理的新概念和评估方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →