研究人员发现了一种名为CPInj的新型去中心化大型语言模型提示优化系统漏洞。该攻击针对协作式提示优化循环,恶意指令可以通过提示聚合注入并传播,从而降低性能并逃避当前防御。为解决此问题,提出了一种名为APAgg的面向防御的聚合方法,旨在净化恶意指令并部分恢复效用,尽管该攻击仍然是一个重大挑战。 AI
影响 突出了去中心化LLM训练方法中的关键漏洞,需要为协作式提示优化提供更强大的安全措施。
排序理由 详细介绍LLM提示优化新攻击和防御的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →