Diffusion language models
PulseAugur coverage of Diffusion language models — every cluster mentioning Diffusion language models across labs, papers, and developer communities, ranked by signal.
- instance of Diffusion Large Language Models 90%
- instance of LLaDA-8B 90%
- competes with autoregressive model 80%
- instance of Masked Diffusion Language Models 70%
- instance of autoregressive model 70%
- affiliated with Masked Diffusion Language Models 70%
- instance of Masked Diffusion Models 70%
- developed by autoregressive model 50%
7 天有情绪数据
-
新方法提升扩散语言模型效率和质量 · 跟踪10个来源
研究人员正在开发新方法来提高扩散语言模型(DLMs)的效率和质量。这些模型与自回归模型不同,通过迭代去噪生成文本,面临推理速度和保持生成质量的挑战。诸如 Affix Cache、前向无损扩散语言模型(FReDA)、依赖感知可撤销解码(DARD)和生存引导长度解码等新技术旨在通过选择性地重新计算标记、消除手工设计的正向过程、改进上下文验证和控制输出长度来优化 DLM 性能。这些进展有望带来更快的推理速度、更高的准确性和增强的文本生成控制能力。
-
新的DeMTS框架增强了扩散语言模型的幻觉检测能力
研究人员开发了一个名为DeMTS的新框架,以改进扩散大型语言模型(D-LLMs)中的幻觉检测。该方法将去噪轨迹视为多元时间序列,保留了先前方法所忽略的二维令牌-步长结构。通过将令牌信号转换为稳定的潜在变量并采用动态多元时间建模,DeMTS能有效捕捉不一致收敛和跨令牌故障传播等模式,从而在各种基准测试和D-LLM骨干模型上实现卓越的幻觉预测性能。
-
Diffusion LMs 推动无损文本压缩,超越 LLMs 和 zstd
研究人员引入了扩散语言模型(DLMs)作为无损文本压缩的新方法,旨在克服现有自回归 LLM 方法的吞吐量限制。该新框架在最近的 arXiv 论文中进行了详细介绍,通过解决符号编码决策的相关挑战来适应 DLMs 进行压缩。在 enwik8 基准测试上的实验结果表明,基于 DLM 的框架实现了最先进的压缩比,超越了 zstd 和 gzip 等传统压缩器,并且性能优于之前的基于 LLM 的压缩技术。
-
Continuous Interaction Diffusion (CID) 架构增强了 LLM 的工具使用能力
研究人员推出了一种新颖的扩散语言模型 (dLLMs) 架构——Continuous Interaction Diffusion (CID),它增强了 dLLMs 使用外部工具的能力。与需要暂停生成以等待工具结果的自回归模型不同,CID 将工具交互直接集成到迭代去噪过程中。这使得信息的使用更有效、更及时,因为工具调用可以在推理周期的早期启动并整合结果,从而可能提高准确性并减少冗余计算。
-
新研究质疑扩散语言模型视觉检索增强生成中无条件证据扩展的有效性
一篇新研究论文探讨了检索增强生成(RAG)在扩散语言模型(DLMs)中用于视觉问答的有效性。研究发现,虽然扩展检索证据集可以提高召回率,但由于DLM内部的语义冲突,它通常会降低答案的准确性。为了解决这个问题,研究人员提出了基于熵的候选过滤器(ECF),这是一个选择性地接纳证据以维持覆盖范围同时减轻有害内容的框架。ECF在多个DLM和基准测试中都显示出答案准确性的提高。
-
Diffusion language models research tackles efficiency and confidence gaps · 6 sources tracked
近期研究探索了提高扩散语言模型(DLM)效率和有效性的方法。一篇论文研究了在解码过程中何时真正需要无分类器引导(CFG),认为其益处是特定于提示的,并且通常集中在过程的早期。另一项研究介绍了 Archer,一种无需训练的 KV 缓存方法,通过自适应地重用提示隐藏状态来加速 DLM 中的回滚能力。进一步的研究解决了 DLM 中的“表示-置信度差距”问题,即内部准确性信号与外部置信度分数不一致,并提出了一个轻量级工具来改进答案排名。此外,…
-
量子电路在理论上显示出优于经典大语言模型的优势
研究人员已经证明了量子电路与经典大语言模型(LLMs)之间的理论分离。该研究证明,某些量子计算,特别是涉及低深度量子电路(如QNC^0)的计算,可以执行当前大语言模型架构(如Transformer和扩散语言模型)在计算上不可行的任务。这些分离在分布和功能背景下都得到了证明,表明了未来量子计算在AI方面可能超越经典AI的潜在领域。
-
语言模型语义空间对词语关系的表征各异
研究人员调查了语言模型向量空间中语义关系的几何表征。他们的研究探讨了与目标词相关的词是否占据相似的区域,以及不同关系是否具有不同的区域。研究结果表明,在非对称关系中,相关词倾向于比对称关系中的相关词更清晰地聚集在一起,并且模型部分编码了对称性和传递性等属性。研究还强调,因果语言模型更依赖词汇信息,而掩码模型和扩散模型则优先考虑上下文信息来构建关系几何。
-
新研究解决了掩码扩散语言模型的评估和架构问题
两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。
-
扩散语言模型:效率、鲁棒性和路由创新
近期研究探索了扩散语言模型(DLM)的进展,重点关注提高其效率和鲁棒性。一篇论文将专家选择路由(Expert-Choice Routing)引入作为DLM的优于令牌选择路由(Token-Choice Routing)的替代方案,实现了更好的负载均衡和更快的收敛。另一项研究提出了AURORA-LM,一种连续潜在扩散语言模型,它将表示构建与分布建模分开,在生成和摘要任务上取得了强劲的性能。进一步的研究调查了ODB-dLLM等加速框架,该框…
-
新的解码方法提高了扩散语言模型的速度和准确性
研究人员开发了新的方法来加速扩散语言模型(dLLMs)的解码过程。一篇论文中提出的FlowBlock使用“门控波前解码”和“异构波前打包”的无需训练的方法,与现有的串行方法相比,实现了显著的速度提升和准确性改进。另一篇论文介绍了AdaLook,一个自适应多步前瞻框架,它根据解码状态动态调整其探索深度,优于简单的单步前瞻技术。
-
新研究加速扩散语言模型训练并增强生成能力
研究人员正在探索掩码扩散语言模型(MDMs)的进步,以提高其训练效率和生成能力。一项研究提出了一种“钟形时间采样”策略,可将MDM训练速度提高多达四倍,同时在One Billion Word Benchmark等基准测试中保持性能。另一篇论文介绍了多掩码扩散模型(MultiMDMs),通过保留掩码结构来增强少步生成,从而在精炼为干净标记之前更好地预测指定掩码。此外,一个名为基于轨迹的策略内蒸馏(TOPD)的新框架允许扩散语言模型在没有…
-
新研究提升扩散语言模型的效率和语义 · 跟踪3个来源
研究人员开发了新方法来改进扩散语言模型,解决了其效率和语义理解方面的局限性。其中一种方法 JUMP 通过实现对微调的离散扩散语言模型的单次传递分析来增强成员推理攻击,显著提高了准确性,优于先前的方法。另一项开发 CoDD 通过引入一个轻量级的概率推理层来解决“因子分解障碍”,该层允许在不增加过多参数的情况下实现更具表现力的联合分布,从而实现更快、更连贯的生成。此外,REGLUE 将视觉基础模型的全局和局部语义集成到潜在扩散模型中,提高…
-
新的掩码感知策略梯度在基准测试中提升DLM推理能力 · 跟踪2个来源
研究人员开发了一种名为掩码感知策略梯度的新方法,以增强扩散语言模型(DLMs)的推理能力。该方法通过准确估计对数似然,解决了将强化学习应用于掩码扩散语言模型(MDLMs)的挑战。该技术将生成过程形式化为两阶段动作马尔可夫决策过程,优化了token放置和掩码决策。这种双重优化在数学推理和编码基准测试中取得了最先进的结果,在GSM8K上达到87.1%,在MBPP上达到53.4%。
-
新的Sangam系统可高效服务扩散式大语言模型
研究人员开发了Sangam,一个新颖的、旨在高效处理扩散式大语言模型(dLLMs)的服务系统。与传统的自回归模型不同,dLLMs通过迭代去噪生成文本,并且由于其双向注意力机制,无法直接应用标准的KV缓存。Sangam通过引入一个赤字令牌预算调度器来解决这个问题,该调度器优先处理正在进行的解码,并仅在令牌预算允许时才允许整个预填充,从而确保了摊销的无停滞调度。该系统还采用了一种混合服务策略来管理预填充-解码资源分区,从而优化了对解码密集…
-
新型扩散语言模型统一文本与图学习
研究人员开发了TAG-DLM,一种将文本推理和图消息传递统一在掩码扩散语言模型中的新方法。该方法将局部图邻域线性化为令牌序列,通过拓扑注意力掩码注入图结构。TAG-DLM在文本属性图基准测试中表现出色,其性能比现有的图神经网络、图Transformer和基于LLM的基线高出3.9个百分点。
-
苹果研究人员通过新的解码技术推进扩散语言模型
苹果的机器学习研究部门发表了几篇论文,详细介绍了扩散语言模型(dLLMs)的进展。与自回归模型相比,这些模型通过并行解码多个 token,有可能实现更快的推理。研究包括探索用于口语模型的连续扩散、通过残差上下文扩散(RCD)提高 dLLM 的效率,以及使用强化学习训练解遮蔽策略。其他工作则侧重于通过专家产品(PoE)等技术弥合扩散模型和自回归模型之间的差距,并开发统一不同解码策略的混合模型。
-
全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展
研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…
-
TimpaTeks 通过扩散语言模型实现文本原地修改
研究人员开发了 TimpaTeks,一种使用扩散语言模型(DLM)进行文本原地修改的新方法。该技术允许在现有文本序列中进行概念引导,而无需指令调优模型。在情感分析和概念修改方面的实验证明了 TimpaTeks 在保持句子结构和降低困惑度方面修改文本的有效性,为基于提示的引导提供了一种计算效率更高的方法。
-
新方法提升扩散语言模型解码速度和质量
研究人员正在开发新方法来改进扩散语言模型(DLM)的解码过程。DLM能够并行生成文本,但目前在质量上落后于自回归模型。几篇论文提出了新颖技术,通过更好地捕捉词元关系和改进扩散解码器与语言模型之间的接口来弥合这一差距。这些进展旨在提高DLM生成的速度和准确性,使其在数学推理和代码生成等复杂任务中更具竞争力。