LLaDA-8B
PulseAugur coverage of LLaDA-8B — every cluster mentioning LLaDA-8B across labs, papers, and developer communities, ranked by signal.
-
新方法使用离散扩散模型进行无需训练的多标签文本分类
研究人员推出了一种名为dLLM-SetScore的新方法,该方法利用离散掩码扩散语言模型进行多标签文本分类,而无需进行特定任务的微调。该方法通过对每个潜在标签提出是/否问题,并比较答案标记的概率来实现。为避免偏差,该方法采用每标签评分,将每个标签置于相同的句法位置,以防止先前方法中观察到的依赖于顺序的伪影。在Reuters和GoEmotions等数据集上的评估表明,使用此协议的LLaDA-Instruct检查点在无需训练的情况下取得了…
-
扩散语言模型:效率、鲁棒性和路由创新
近期研究探索了扩散语言模型(DLM)的进展,重点关注提高其效率和鲁棒性。一篇论文将专家选择路由(Expert-Choice Routing)引入作为DLM的优于令牌选择路由(Token-Choice Routing)的替代方案,实现了更好的负载均衡和更快的收敛。另一项研究提出了AURORA-LM,一种连续潜在扩散语言模型,它将表示构建与分布建模分开,在生成和摘要任务上取得了强劲的性能。进一步的研究调查了ODB-dLLM等加速框架,该框…
-
Sangam 系统优化扩散式大语言模型的服务
研究人员开发了 Sangam,一个旨在高效处理扩散式大语言模型(dLLMs)的新服务系统。与传统的自回归模型不同,dLLMs 迭代生成文本并具有双向注意力机制,这使得标准的缓存技术变得复杂。Sangam 引入了一个赤字 token 预算调度器来管理进行中的解码和整个预填充,目标是实现摊销的无停滞调度。该系统还采用了一种混合服务策略来平衡预填充和解码的资源分配,在 LLaDA-8B 和 Dream-7B 等基准测试中显示出比现有方法更高的延迟改进。
-
新的Sangam系统可高效服务扩散式大语言模型
研究人员开发了Sangam,一个新颖的、旨在高效处理扩散式大语言模型(dLLMs)的服务系统。与传统的自回归模型不同,dLLMs通过迭代去噪生成文本,并且由于其双向注意力机制,无法直接应用标准的KV缓存。Sangam通过引入一个赤字令牌预算调度器来解决这个问题,该调度器优先处理正在进行的解码,并仅在令牌预算允许时才允许整个预填充,从而确保了摊销的无停滞调度。该系统还采用了一种混合服务策略来管理预填充-解码资源分区,从而优化了对解码密集…
-
新框架提升移动NPU上的端侧LLM推理性能
研究人员开发了一个名为“this http URL”的新框架,旨在优化移动设备上扩散大型语言模型(dLLMs)的推理。该框架解决了移动NPU架构固有的工作负载缩小和复杂数据管理等挑战。它采用了多块投机解码和双路径渐进式修订等技术,在保持输出质量的同时显著降低了生成延迟。
-
全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展
研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…
-
新的 CreditDecoding 方法加速扩散 LLM 文本生成
研究人员开发了一种名为 CreditDecoding 的新方法,以加速扩散大型语言模型 (dLLM) 的文本生成过程。该技术解决了模型预测正确 token 的时间早于其解码置信度分数允许的时间的效率低下问题,导致冗余迭代。CreditDecoding 使用“Trace Credit”量化 token 的解码潜力,并将其与当前模型输出融合,以提高对正确但置信度不足的 token 的信心。这种无需训练的方法在各种基准测试和 dLLM 架构…