Fast-dLLM++
PulseAugur coverage of Fast-dLLM++ — every cluster mentioning Fast-dLLM++ across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
扩散语言模型:效率、鲁棒性和路由创新
近期研究探索了扩散语言模型(DLM)的进展,重点关注提高其效率和鲁棒性。一篇论文将专家选择路由(Expert-Choice Routing)引入作为DLM的优于令牌选择路由(Token-Choice Routing)的替代方案,实现了更好的负载均衡和更快的收敛。另一项研究提出了AURORA-LM,一种连续潜在扩散语言模型,它将表示构建与分布建模分开,在生成和摘要任务上取得了强劲的性能。进一步的研究调查了ODB-dLLM等加速框架,该框…
-
BlockServe框架将dLLM服务吞吐量提升高达10.6倍
研究人员开发了BlockServe,一个旨在提高扩散式大语言模型(dLLM)服务效率的新框架。该系统通过实现块粒度调度来解决批处理中的收敛异构性挑战,该调度允许在块边界立即驱逐已完成的请求。BlockServe还利用混合状态执行和计算感知准入控制器来扩大有效批容量。在各种基准测试中对Dream和LLaDA模型进行的实验表明,与Fast-dLLM相比,BlockServe的吞吐量可提高1.9倍至10.6倍,同时保持相似的生成质量。
-
BlockServe框架将dLLM服务吞吐量提升高达10.6倍
研究人员开发了BlockServe,一个旨在提高扩散式大语言模型(dLLM)服务效率的新型框架。该系统通过实现块粒度调度来解决批处理中异构收敛速率的挑战,该调度允许在块边界立即驱逐已完成的请求。BlockServe还集成了混合状态执行和面向计算的准入控制器,以扩大批处理容量。在Dream和LLaDA基准测试上的实验表明,与Fast-dLLM++等现有方法相比,BlockServe在保持生成质量的同时可以实现更高的吞吐量。
-
Sangam 系统优化扩散式大语言模型的服务
研究人员开发了 Sangam,一个旨在高效处理扩散式大语言模型(dLLMs)的新服务系统。与传统的自回归模型不同,dLLMs 迭代生成文本并具有双向注意力机制,这使得标准的缓存技术变得复杂。Sangam 引入了一个赤字 token 预算调度器来管理进行中的解码和整个预填充,目标是实现摊销的无停滞调度。该系统还采用了一种混合服务策略来平衡预填充和解码的资源分配,在 LLaDA-8B 和 Dream-7B 等基准测试中显示出比现有方法更高的延迟改进。