研究人员开发了 ToxScreen,这是一个旨在检测被投毒的大型语言模型(LLM)的新基准测试。该基准测试包含约 800 个带有后门的模型,涵盖了各种攻击目标、触发机制和模型规模。研究发现,基于梯度的提示优化在恢复触发器方面无效,但通过攻击成功率对候选者进行排名的令牌查找方法可以在后门有效时恢复触发器。研究还发现,后门通过不同于越狱的机制策略运作,这为防御者过滤越狱提供了一种方法。 AI
影响 为检测和缓解 LLM 中的数据投毒攻击提供了一个新的基准测试和方法,这对于高风险部署至关重要。
排序理由 该集群包含一篇学术论文,详细介绍了检测被投毒的大型语言模型的新基准测试和方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →