研究人员引入了去噪工作负载表面(DWS),以更准确地对服务期间扩散大语言模型(dLLM)的推理成本进行建模和预测。传统的成本代理对于 dLLM 来说是不够的,因为它们无法捕捉其生成过程的二维结构,该过程涉及具有异构成本的输出块和去噪步骤。DWS 将此结构保留为概率表面,从而能够使用轻量级的、仅提示的预测器来有效估算成本。这种方法在实际服务实验中显示出显著的改进,将成本预测误差降低了高达 2.50 倍,并将端到端延迟降低了高达 1.92 倍。 AI
影响 这种新方法可能导致 dLLM 部署的更有效的资源分配和更低的延迟。
排序理由 该集群包含一篇学术论文,详细介绍了用于扩散大语言模型推理成本建模和预测的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →