PulseAugur
中
实时 22:54:46
English(EN) Why Jailbreaks Succeed in Diffusion Language Models: An Energy Landscape Analysis

新框架通过能量景观分析解释LLM越狱

研究人员开发了一个新框架,以理解为什么越狱在基于扩散的大型语言模型(dLLMs)中会成功。他们提出,安全对齐可以被视为塑造模型的能量景观,其中有害查询通过能量壁垒被引导远离安全输出。越狱攻击通过在初始阶段掩盖查询的有害意图,或在生成过程中进行干预以强制路径越过该壁垒来起作用。该研究引入了三个基于初始安全倾向和轨迹速度的免训练检测信号,并在包括LLaDA-8B、LLaDA 1.5、Dream-7B和LLaDA-MoE-7B在内的多个dLLMs上进行了测试,证实了它们的有效性。 AI

影响 为理解和潜在缓解LLM越狱提供了理论框架。

排序理由 分析LLM安全漏洞的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架通过能量景观分析解释LLM越狱

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran ·

    为什么越狱在扩散语言模型中会成功:能量景观分析

    arXiv:2609.30841v1 Announce Type: new Abstract: Existing attacks and defenses for diffusion-based large language models (dLLMs) target specific vulnerabilities but lack a shared framework explaining why attacks succeed. We propose one by interpreting safety alignment as shaping t…