Masked Diffusion Models
PulseAugur coverage of Masked Diffusion Models — every cluster mentioning Masked Diffusion Models across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新理论量化扩散模型中的并行采样成本
研究人员开发了一个新的自适应并行离散向量采样理论框架,其动机是掩码扩散模型中的并行解码。核心发现是将库尔巴克-莱布勒散度测量的近似误差与揭示轮次中累积的条件总相关性联系起来的一个精确恒等式。该恒等式将条件总相关性确立为轮内并行性的基本信息成本。该研究为马尔可夫链和伯努利游走等各种结构提供了优化的采样计划,并证明了串行深度和熵之间的分离。使用掩码扩散语言模型的实验表明,该框架可以有效地区分不同的解码规则并预测输出质量。
-
扩散语言模型:效率、鲁棒性和路由创新
近期研究探索了扩散语言模型(DLM)的进展,重点关注提高其效率和鲁棒性。一篇论文将专家选择路由(Expert-Choice Routing)引入作为DLM的优于令牌选择路由(Token-Choice Routing)的替代方案,实现了更好的负载均衡和更快的收敛。另一项研究提出了AURORA-LM,一种连续潜在扩散语言模型,它将表示构建与分布建模分开,在生成和摘要任务上取得了强劲的性能。进一步的研究调查了ODB-dLLM等加速框架,该框…
-
新研究加速扩散语言模型训练并增强生成能力
研究人员正在探索掩码扩散语言模型(MDMs)的进步,以提高其训练效率和生成能力。一项研究提出了一种“钟形时间采样”策略,可将MDM训练速度提高多达四倍,同时在One Billion Word Benchmark等基准测试中保持性能。另一篇论文介绍了多掩码扩散模型(MultiMDMs),通过保留掩码结构来增强少步生成,从而在精炼为干净标记之前更好地预测指定掩码。此外,一个名为基于轨迹的策略内蒸馏(TOPD)的新框架允许扩散语言模型在没有…
-
新的SC-CMJP框架统一了图像理解与生成
研究人员引入了自校正耦合马尔可夫跳跃过程(SC-CMJP),一个旨在将图像理解与生成整合到人工智能系统中的新框架。与先前独立更新模态的方法不同,该方法允许模态在同一步骤内相互影响。SC-CMJP包含一个重新掩码机制,用于检测和纠正跨模态的矛盾。该框架附带了一个无需训练的采样器CO2Jump,以及三个新的大规模多模态语料库:JEdit-1M、JMaze-200K和JNono-200K,用于训练和评估。
-
新的PUMA方法加速了遮蔽扩散模型的训练
研究人员推出了一种名为渐进式解遮蔽(Progressive UnMAsking, PUMA)的新方法,用于加速遮蔽扩散模型(MDMs)的训练。PUMA使训练期间使用的遮蔽模式与推理期间使用的模式保持一致,从而将优化集中在更相关的遮蔽上。该方法在预训练方面显示出显著的加速效果,在1.25亿参数规模下,训练时间大约快了2.5倍。
-
BlockGen 模型探索使用混合采样器进行分块序列生成
研究人员推出了一种新颖的分块序列建模方法 BlockGen,该方法利用混合采样器进行离散扩散。该方法比较了统一状态扩散模型 (USDMs) 与掩码扩散模型 (MDMs) 在分块生成序列(而非逐个 token 生成)时的有效性。BlockGen 将自回归 (AR) 预测与扩散模型相结合,以优化不太可能的 token,在 GSM8K 和 OpenWebText 等任务上表现出竞争力。
-
新研究解决扩散语言模型的局限性
研究人员正在探索改进扩散语言模型(DLM)的新方法,与自回归模型相比,DLM 提供了更快的推理速度。几篇近期论文介绍了增强 DLM 性能的技术,包括用于解耦重掩码的 NAVIRA、用于使用丢弃标记进行检索增强生成的 SARDI,以及用于支持标记揭示的 AXON。另一项研究确定了 DLM 的局限性,例如局部性偏差和来自掩码标记的干扰,并提出了一种无掩码的损失函数来改善上下文理解。此外,一项调查全面概述了 DLM 的格局,涵盖了基本原理、…
-
新的大语言模型训练方法提高了效率和错误恢复能力
研究人员开发了提高大语言模型(LLM)训练效率的新技术。一种名为“步进拒绝微调”(SRFT)的方法,通过评估每个步骤的正确性来利用不成功的训练轨迹,使模型能够在不重复错误的情况下从中学习。该方法将SWE-bench任务的解决率提高了3.7%。另一项开发,“无限掩码扩散模型”(IMDM),通过引入随机无限状态掩码来解决掩码扩散模型(MDMs)中的因子化错误。IMDM展示了卓越的几步生成能力,并在与蒸馏结合时,在LM1B和OpenWebT…