一篇新的 arXiv 研究论文探讨了服务掩码扩散语言模型(dLLM)的挑战,dLLM 通过同时去噪多个 token,可以比传统的自回归模型更快地生成文本。该研究使用 NVIDIA H200 GPU 上的 LLaDA-8B-Instruct 和 D2F LoRA 适配器,发现请求的难度是离散的,而不是连续的,请求分为 11 个固定的步数级别。具有较短生成预算的基准测试可能会低估服务方差,并且相当一部分挂钟时间花在 CPU 端的分发开销上,而不是 GPU 计算上。批处理主要通过分摊此开销来提高吞吐量,每个去噪步骤共享前向传递可带来显著收益。 AI
影响 强调了为扩散模型提供专门的服务基础设施的必要性,这与自回归模型不同,并强调了批处理策略来管理开销。
排序理由 该集群包含一篇详细介绍服务 AI 模型的技术发现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- D2F (Discrete Diffusion Forcing)
- GSM8K
- Hugging Face
- HumanEval
- LLaDA 8B Instruct
- LoRA+
- Masked Diffusion Language Models
- NVIDIA H200
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →