Diffusion LLMs
PulseAugur coverage of Diffusion LLMs — every cluster mentioning Diffusion LLMs across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
LaCache 通过 token 缓存将 diffusion LLM 加速 1.3 倍
一种名为 LaCache 的新缓存技术已被开发出来,用于加速 diffusion 大型语言模型。该方法在去噪过程中缓存未更改的 token,从而在独立推理中实现 1.3 倍的速度提升。当与其他加速技术结合使用时,LaCache 可实现高达 40 倍的速度提升。
-
新方法加速Diffusion LLM,解决速度-质量权衡问题 · 跟踪3个来源
研究人员正在开发新的方法来加速Diffusion大型语言模型(dLLM),由于其序列长度缩放,这些模型计算量很大。两个新框架Dynamic-dLLM和Streaming-dLLM旨在提高推理速度而不牺牲生成质量。Dynamic-dLLM使用自适应缓存预算和并行解码,而Streaming-dLLM采用后缀修剪和带有早期退出机制的动态解码。另一项研究ParallelBench强调了dLLM并行解码的权衡,揭示了在现实场景中质量的显著下降以…
-
新的 DSB 方法优化扩散 LLM 调度,以提高质量和效率
研究人员推出了一种用于扩散大型语言模型 (dLLMs) 的新型调度方法——动态滑动块 (DSB),旨在同时提高生成质量和推理效率。与固定的块调度不同,DSB 根据语义难度动态调整块大小,防止过早承诺并优化处理时间。该方法还包含 DSB Cache,一种补充性的 KV 缓存机制,旨在通过 DSB 进一步提高效率。实验表明,这种方法在各种模型和基准测试中始终能产生更好的结果。
-
新的DAPD方法加速了扩散式大语言模型的解码
研究人员推出了一种新颖的依赖感知并行解码(DAPD)方法,用于加速扩散式大语言模型(dLLMs)的解码过程。DAPD利用自注意力构建条件依赖图,通过识别图中的独立集来实现标记的并行去掩码。这种无需训练的方法避免了辅助模型或重新训练的需要,提高了准确性-步数权衡,并更好地利用了dLLMs的任意顺序生成能力。
-
新的微调方法可在不改写的情况下增强LLM知识注入
研究人员开发了一种名为扩散启发式掩码微调(DMT)的新型微调方法,用于自回归大型语言模型(LLM)。该技术旨在改进事实知识向LLM的注入,解决了对计算成本高昂的改写和逆转诅咒的依赖等问题。实验表明,DMT显著提高了知识注入的效率,在无需改写的情况下即可达到扩散LLM的性能,并展示了其在包括数学在内的各种任务中的广泛适用性。