Fast-dLLM++
PulseAugur coverage of Fast-dLLM++ — every cluster mentioning Fast-dLLM++ across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的“early-bird”解码技术加速了扩散式大语言模型
研究人员开发了一个名为“early-bird (EB)”解码的新框架,以显著加速扩散式大语言模型 (dLLMs) 的推理。该方法解决了 dLLMs 推理效率低下的问题,因为 dLLMs 通常需要大量步骤才能达到解码阈值。EB-Decode 引入了一个可学习的网络,该网络能自适应地将不确定性相似的 token 分组为可变长度的块,以及一个位置感知采样器,该采样器使用预测块内更少的步骤并行地解掩 token。这些组件可以作为插件集成,而无…
-
新方法通过推测性解码加速大语言模型推理速度
两篇新的研究论文介绍了加速大语言模型推理速度的新方法。第一篇论文“ReTrace”提出了一种技术,将每个草稿块条件化到上一轮被拒绝的后缀上,从而提高了 Qwen3 等模型的平均接受长度和解码速度。第二篇论文“Trajectory-Level Speculative Decoding”为基于扩散的语言模型(dLLMs)提出了一个框架,该框架对去噪轨迹进行推测,与 vanilla dLLMs 和 Fast-dLLM++ 等现有框架相比,实…
-
扩散语言模型:效率、鲁棒性和路由创新
近期研究探索了扩散语言模型(DLM)的进展,重点关注提高其效率和鲁棒性。一篇论文将专家选择路由(Expert-Choice Routing)引入作为DLM的优于令牌选择路由(Token-Choice Routing)的替代方案,实现了更好的负载均衡和更快的收敛。另一项研究提出了AURORA-LM,一种连续潜在扩散语言模型,它将表示构建与分布建模分开,在生成和摘要任务上取得了强劲的性能。进一步的研究调查了ODB-dLLM等加速框架,该框…
-
BlockServe框架将dLLM服务吞吐量提升高达10.6倍
研究人员开发了BlockServe,一个旨在提高扩散式大语言模型(dLLM)服务效率的新框架。该系统通过实现块粒度调度来解决批处理中的收敛异构性挑战,该调度允许在块边界立即驱逐已完成的请求。BlockServe还利用混合状态执行和计算感知准入控制器来扩大有效批容量。在各种基准测试中对Dream和LLaDA模型进行的实验表明,与Fast-dLLM相比,BlockServe的吞吐量可提高1.9倍至10.6倍,同时保持相似的生成质量。
-
BlockServe框架将dLLM服务吞吐量提升高达10.6倍
研究人员开发了BlockServe,一个旨在提高扩散式大语言模型(dLLM)服务效率的新型框架。该系统通过实现块粒度调度来解决批处理中异构收敛速率的挑战,该调度允许在块边界立即驱逐已完成的请求。BlockServe还集成了混合状态执行和面向计算的准入控制器,以扩大批处理容量。在Dream和LLaDA基准测试上的实验表明,与Fast-dLLM++等现有方法相比,BlockServe在保持生成质量的同时可以实现更高的吞吐量。
-
Sangam 系统优化扩散式大语言模型的服务
研究人员开发了 Sangam,一个旨在高效处理扩散式大语言模型(dLLMs)的新服务系统。与传统的自回归模型不同,dLLMs 迭代生成文本并具有双向注意力机制,这使得标准的缓存技术变得复杂。Sangam 引入了一个赤字 token 预算调度器来管理进行中的解码和整个预填充,目标是实现摊销的无停滞调度。该系统还采用了一种混合服务策略来平衡预填充和解码的资源分配,在 LLaDA-8B 和 Dream-7B 等基准测试中显示出比现有方法更高的延迟改进。