LLaDA 1.5
PulseAugur coverage of LLaDA 1.5 — every cluster mentioning LLaDA 1.5 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架通过能量景观分析解释LLM越狱
研究人员开发了一个新框架,以理解为什么越狱在基于扩散的大型语言模型(dLLMs)中会成功。他们提出,安全对齐可以被视为塑造模型的能量景观,其中有害查询通过能量壁垒被引导远离安全输出。越狱攻击通过在初始阶段掩盖查询的有害意图,或在生成过程中进行干预以强制路径越过该壁垒来起作用。该研究引入了三个基于初始安全倾向和轨迹速度的免训练检测信号,并在包括LLaDA-8B、LLaDA 1.5、Dream-7B和LLaDA-MoE-7B在内的多个dL…
-
扩散语言模型通过新的效率和安全技术取得进展 · 跟踪 10 个来源
近期研究探讨了扩散语言模型(DLM)的进展,重点在于提高其效率、安全性和能力。论文介绍了 Q-Skew 等方法,用于隐私风险评估和个人身份信息(PII)提取;以及通过识别早期去噪步骤中的拒绝信号来增强安全对齐的 Refusal-Aware Early Commitment (RAEC)。CARVE 和 Survival-Guided Length Decoding 等技术旨在优化生成长度和降低计算成本,而 Affix Cache 和 …
-
新方法加速Diffusion LLM,解决速度-质量权衡问题 · 跟踪3个来源
研究人员正在开发新的方法来加速Diffusion大型语言模型(dLLM),由于其序列长度缩放,这些模型计算量很大。两个新框架Dynamic-dLLM和Streaming-dLLM旨在提高推理速度而不牺牲生成质量。Dynamic-dLLM使用自适应缓存预算和并行解码,而Streaming-dLLM采用后缀修剪和带有早期退出机制的动态解码。另一项研究ParallelBench强调了dLLM并行解码的权衡,揭示了在现实场景中质量的显著下降以…