研究人员开发了一个新框架,以理解为什么越狱在基于扩散的大型语言模型(dLLMs)中会成功。他们提出,安全对齐可以被视为塑造模型的能量景观,其中有害查询通过能量壁垒被引导远离安全输出。越狱攻击通过在初始阶段掩盖查询的有害意图,或在生成过程中进行干预以强制路径越过该壁垒来起作用。该研究引入了三个基于初始安全倾向和轨迹速度的免训练检测信号,并在包括LLaDA-8B、LLaDA 1.5、Dream-7B和LLaDA-MoE-7B在内的多个dLLMs上进行了测试,证实了它们的有效性。 AI
影响 为理解和潜在缓解LLM越狱提供了理论框架。
排序理由 分析LLM安全漏洞的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →