Diffusion Large Language Models
PulseAugur coverage of Diffusion Large Language Models — every cluster mentioning Diffusion Large Language Models across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新方法解决视觉语言和语音AI模型的幻觉问题 · 跟踪4个来源
研究人员正在开发新的方法来检测和减轻大型语言模型中的幻觉,特别是在视觉语言和语音环境中。SHROOM-Visions 2026 共享任务专注于识别多语言图像条件文本生成中的细粒度幻觉跨度。此外,正在为扩散大型语言模型开发 DynHD 等新方法,通过分析去噪动态来查明幻觉。另一种方法,基于分割的注意力熵 (SAE),通过检查视觉注意力模式来解决视觉语言模型中的对象幻觉。
-
新方法提升扩散语言模型效率和质量 · 跟踪10个来源
研究人员正在开发新方法来提高扩散语言模型(DLMs)的效率和质量。这些模型与自回归模型不同,通过迭代去噪生成文本,面临推理速度和保持生成质量的挑战。诸如 Affix Cache、前向无损扩散语言模型(FReDA)、依赖感知可撤销解码(DARD)和生存引导长度解码等新技术旨在通过选择性地重新计算标记、消除手工设计的正向过程、改进上下文验证和控制输出长度来优化 DLM 性能。这些进展有望带来更快的推理速度、更高的准确性和增强的文本生成控制能力。
-
Diffusion LLMs 在翻译和形式语言生成方面取得进展 · 跟踪 2 个来源
两篇新的研究论文探讨了扩散大型语言模型(dLLMs)在机器翻译和形式语言生成方面的进展。第一篇论文介绍了熵谷(EV),一种用于机器翻译中 dLLMs 的无训练长度选择方法,它改进了目标长度选择,并取得了与自回归模型相比具有竞争力的结果。第二篇论文提出了 LAVE,一种用于 dLLMs 的约束解码方法,通过使用前瞻和验证来保持语法正确性,同时开销极小,从而确保形式语言的可靠生成。
-
Ripple-Pivot Search 将 Diffusion LLM 推理速度提高了 18 倍
研究人员推出了一种名为 Ripple-Pivot Search (RPS) 的新型扩散大型语言模型 (dLLM) 解码方法,该方法显著加快了推理速度。RPS 利用一种“涟漪效应”,即早期确定中间熵位置可以降低后续位置的不确定性,从而实现更快的并行解码。该方法在推理和代码生成任务上比标准解码器快 4-10 倍,与 KV 缓存结合使用时,有潜力将速度提高高达 18 倍,同时保持生成质量。
-
新研究加速扩散语言模型训练并增强生成能力
研究人员正在探索掩码扩散语言模型(MDMs)的进步,以提高其训练效率和生成能力。一项研究提出了一种“钟形时间采样”策略,可将MDM训练速度提高多达四倍,同时在One Billion Word Benchmark等基准测试中保持性能。另一篇论文介绍了多掩码扩散模型(MultiMDMs),通过保留掩码结构来增强少步生成,从而在精炼为干净标记之前更好地预测指定掩码。此外,一个名为基于轨迹的策略内蒸馏(TOPD)的新框架允许扩散语言模型在没有…
-
Polestar 框架提升扩散式 LLM 推理效率和准确性
研究人员推出 Polestar,一个旨在提高扩散式大型语言模型 (dLLM) 推理效率的新颖框架。Polestar 解决了两个关键挑战:由于双向注意力而无法有效重用 KV 缓存,以及在静态置信度阈值下增加并行性时生成的质量受损。通过观察到 Token 表示漂移是这两个问题的共同原因,Polestar 采用了一种无需训练的方法。它包括 Polestar-Cache,用于基于漂移检测进行稀疏 KV 缓存刷新;以及 Polestar-Com…
-
BlockServe框架将dLLM服务吞吐量提升高达10.6倍
研究人员开发了BlockServe,一个旨在提高扩散式大语言模型(dLLM)服务效率的新框架。该系统通过实现块粒度调度来解决批处理中的收敛异构性挑战,该调度允许在块边界立即驱逐已完成的请求。BlockServe还利用混合状态执行和计算感知准入控制器来扩大有效批容量。在各种基准测试中对Dream和LLaDA模型进行的实验表明,与Fast-dLLM相比,BlockServe的吞吐量可提高1.9倍至10.6倍,同时保持相似的生成质量。
-
新的大语言模型研究涵盖多模态对齐、推理审计和能源使用 · 已追踪 10 个来源
近期研究探讨了大语言模型(LLM)能力和局限性的各个方面。一项研究调查了多模态大语言模型的对齐问题,提出了一种新的数据生成方法来提高图像-文本一致性。另一篇论文介绍了一种用于评估大语言模型推理的协议级审计,突出了基准分数与实际行为属性之间的差异。进一步的研究利用围棋死活题探究了大语言模型的推理效率,揭示了当前模型在搜索组织方面存在困难。此外,还有研究考察了大语言模型的能耗、默认设置和代币定价对推理服务的影响,以及低资源编程语言基准的开发。
-
新方法加速Diffusion LLM,解决速度-质量权衡问题 · 跟踪3个来源
研究人员正在开发新的方法来加速Diffusion大型语言模型(dLLM),由于其序列长度缩放,这些模型计算量很大。两个新框架Dynamic-dLLM和Streaming-dLLM旨在提高推理速度而不牺牲生成质量。Dynamic-dLLM使用自适应缓存预算和并行解码,而Streaming-dLLM采用后缀修剪和带有早期退出机制的动态解码。另一项研究ParallelBench强调了dLLM并行解码的权衡,揭示了在现实场景中质量的显著下降以…
-
全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展
研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…
-
FOCUS 系统将 DLLM 推理速度提升 3.5 倍
研究人员开发了一个名为 FOCUS 的新推理系统,旨在提高扩散大型语言模型 (DLLM) 的效率。该系统通过动态地将计算集中在最相关的 token 上,而不是将资源浪费在不可解码的 token 上,从而解决了 DLLM 的高解码成本问题。在大型批处理场景下,FOCUS 的吞吐量最多可提高 3.52 倍,同时保持或提高生成质量。
-
新的 CreditDecoding 方法加速扩散 LLM 文本生成
研究人员开发了一种名为 CreditDecoding 的新方法,以加速扩散大型语言模型 (dLLM) 的文本生成过程。该技术解决了模型预测正确 token 的时间早于其解码置信度分数允许的时间的效率低下问题,导致冗余迭代。CreditDecoding 使用“Trace Credit”量化 token 的解码潜力,并将其与当前模型输出融合,以提高对正确但置信度不足的 token 的信心。这种无需训练的方法在各种基准测试和 dLLM 架构…
-
新基准和方法推动多模态大语言模型能力发展
研究人员正在开发新的多模态大语言模型(MLLMs)方法,以提高它们对顺序音视频数据和大规模视觉识别的理解能力。一种方法DLLM-VSR使用扩散模型进行视觉语音识别,通过迭代去噪和解码转录文本取得了最先进的成果。另一篇论文介绍了SONIC-O1,这是一个用于评估MLLMs在真实世界音视频理解能力的基准,突出了不同人口群体之间的性能差异。此外,还在探索用于MLLMs高效训练和推理的新技术,包括用于训练的异构并行以及用于推理的“分而治之”策…
-
新的 D^2-Monitor 系统增强了扩散式大语言模型的安全性
研究人员推出了一种新颖的 D-LLMs 安全监控系统 $D^2$-Monitor。该系统解决了扩散式大语言模型(D-LLMs)监控的独特挑战,D-LLMs 通过多步过程生成文本,暴露了中间表示。$D^2$-Monitor 将“安全犹豫”——即中间状态反复接近探测器的决策边界——识别为潜在探测器失败的关键指标。它采用动态路由机制,仅当犹豫水平超过阈值时才激活资源密集型探测器,从而优化效率。
-
TAD框架提升扩散大语言模型的速度和准确性
研究人员推出了一种名为TAD(时序感知轨迹自蒸馏)的框架,旨在提高扩散大语言模型(dLLMs)的速度和准确性。TAD通过使用教师模型生成解码轨迹来解决文本生成速度越快质量越低的常见权衡问题。然后,它根据token的时间接近度,使用不同的损失函数来训练学生模型,鼓励对近距离token进行自信预测,并为远距离token保留未来规划知识。在LLaDA上的实验表明,在准确性和加速方面都有显著的改进。