Masked Diffusion Language Models
PulseAugur coverage of Masked Diffusion Language Models — every cluster mentioning Masked Diffusion Language Models across labs, papers, and developer communities, ranked by signal.
- 2026-06-15 research_milestone Introduction of the TIE framework for ensembling Masked Diffusion Language Models. 来源
2 天有情绪数据
-
研究详细介绍了更快扩散语言模型的服务挑战
一篇新的 arXiv 研究论文探讨了服务掩码扩散语言模型(dLLM)的挑战,dLLM 通过同时去噪多个 token,可以比传统的自回归模型更快地生成文本。该研究使用 NVIDIA H200 GPU 上的 LLaDA-8B-Instruct 和 D2F LoRA 适配器,发现请求的难度是离散的,而不是连续的,请求分为 11 个固定的步数级别。具有较短生成预算的基准测试可能会低估服务方差,并且相当一部分挂钟时间花在 CPU 端的分发开销上…
-
Diffusion language models research tackles efficiency and confidence gaps · 6 sources tracked
近期研究探索了提高扩散语言模型(DLM)效率和有效性的方法。一篇论文研究了在解码过程中何时真正需要无分类器引导(CFG),认为其益处是特定于提示的,并且通常集中在过程的早期。另一项研究介绍了 Archer,一种无需训练的 KV 缓存方法,通过自适应地重用提示隐藏状态来加速 DLM 中的回滚能力。进一步的研究解决了 DLM 中的“表示-置信度差距”问题,即内部准确性信号与外部置信度分数不一致,并提出了一个轻量级工具来改进答案排名。此外,…
-
新研究应对大语言模型推理、效率和蒸馏挑战 · 跟踪 10 个来源
新研究探索了提高大语言模型(LLMs)推理能力和效率的方法。一篇论文引入了“Trace as State”,通过将推理痕迹置于上下文块之前来增强长上下文推理,在各种模型和数据集上显示出显著的性能提升。另一项研究提出了“SALA”,用于上下文学习中的语义感知逻辑对齐,改进了复杂推理任务的演示选择。此外,关于“HEAL”的研究旨在通过解决当前蒸馏技术的局限性,从 LLMs 中将推理蒸馏到更小的模型中,其灵感来源于教育理论。
-
新研究解决了掩码扩散语言模型的评估和架构问题
两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。
-
Masked Diffusion Language Models outperform AR models for agentic RL
一篇新的研究论文介绍了掩码扩散语言模型(MDLM)作为文本世界模型在代理强化学习中优于自回归(AR)模型的替代方案。MDLM 通过利用双向锚点感知去噪,展示了增强的一致性和扎实性,即使在后者规模大得多的情况下,其性能也优于 AR 模型。该研究还提出了一个新的 GRPO 训练框架,并在各种代理骨干网络上展示了在未见过环境中的大量零样本迁移收益。
-
新研究加速扩散语言模型训练并增强生成能力
研究人员正在探索掩码扩散语言模型(MDMs)的进步,以提高其训练效率和生成能力。一项研究提出了一种“钟形时间采样”策略,可将MDM训练速度提高多达四倍,同时在One Billion Word Benchmark等基准测试中保持性能。另一篇论文介绍了多掩码扩散模型(MultiMDMs),通过保留掩码结构来增强少步生成,从而在精炼为干净标记之前更好地预测指定掩码。此外,一个名为基于轨迹的策略内蒸馏(TOPD)的新框架允许扩散语言模型在没有…
-
新的掩码感知策略梯度在基准测试中提升DLM推理能力 · 跟踪2个来源
研究人员开发了一种名为掩码感知策略梯度的新方法,以增强扩散语言模型(DLMs)的推理能力。该方法通过准确估计对数似然,解决了将强化学习应用于掩码扩散语言模型(MDLMs)的挑战。该技术将生成过程形式化为两阶段动作马尔可夫决策过程,优化了token放置和掩码决策。这种双重优化在数学推理和编码基准测试中取得了最先进的结果,在GSM8K上达到87.1%,在MBPP上达到53.4%。
-
新方法通过自适应解码策略提高 LLM 推理速度
研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。
-
新的TIE框架增强了掩码扩散语言模型的集成
研究人员引入了基于轨迹的迭代集成(TIE)框架,这是一种用于结合掩码扩散语言模型(MDLM)知识的新框架。TIE专注于MDLM独特的解码动态,观察到成功的生成会保持稳定的置信度,而不可靠的生成可以通过整合其他模型的中间状态来改进。TIE框架迭代地识别并转移MDLM之间的可靠解码轨迹,使不同的模型能够在生成过程的各个阶段贡献其优势。这种方法在各种推理任务上表现出强大的性能,为MDLM集成提供了一个实用的解决方案。
-
新方法通过改进填充和知识集成来增强MDLM · 追踪6个来源
研究人员为掩码扩散语言模型(MDLM)引入了两种新颖的方法。第一种,VoidPadding,将序列结束([EOS])标记的语义终止和填充作用解耦,使用新的[VOID]标记进行填充。据报道,该方法在Dream-7B-Instruct等基准测试中提高了性能,并降低了解码效率低下问题。第二种方法,TIE(基于轨迹的迭代集成),侧重于整合来自多个MDLM的知识。TIE通过追踪置信度动态来识别可靠的解码轨迹,并选择性地在模型之间转移中间状态,以…
-
新的遗忘方法针对扩散语言模型
研究人员推出了一种名为掩码扩散遗忘(MDU)的新型框架,旨在从掩码扩散语言模型(MDLM)中移除特定知识。与传统的自回归模型不同,MDLM通过对掩码位置去噪来并行生成文本。MDU将遗忘过程适应于这种基于扩散的生成,旨在将模型预测从特定学习信息中转移出来,同时保持效用。实验表明MDU在MDLM遗忘方面是有效的,并且优于现有方法。
-
新研究解决扩散语言模型的局限性
研究人员正在探索改进扩散语言模型(DLM)的新方法,与自回归模型相比,DLM 提供了更快的推理速度。几篇近期论文介绍了增强 DLM 性能的技术,包括用于解耦重掩码的 NAVIRA、用于使用丢弃标记进行检索增强生成的 SARDI,以及用于支持标记揭示的 AXON。另一项研究确定了 DLM 的局限性,例如局部性偏差和来自掩码标记的干扰,并提出了一种无掩码的损失函数来改善上下文理解。此外,一项调查全面概述了 DLM 的格局,涵盖了基本原理、…