研究人员推出了一种名为 Ripple-Pivot Search (RPS) 的新解码方法,旨在加速 Diffusion Large Language Models (dLLMs) 的推理。RPS 识别并确定中等熵的关键位置,从而降低后续位置的不确定性,实现更并行的解码。这种方法可以比标准解码器实现高达 4-10 倍的实际运行速度提升,同时保持生成质量,并且在结合 KV 缓存时可以实现更高的速度。 AI
影响 可能能够为各种应用更快、更高效地部署基于扩散的 LLM。
排序理由 详细介绍 LLM 推理新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →