PulseAugur
实时 09:14:46
English(EN) D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding

推测解码研究提升消费级硬件上LLM的推理速度

研究人员正在探索推测解码技术以加速大型语言模型(LLM)的推理。两篇论文,一篇来自arXiv,另一篇来自dev.to,详细介绍了在消费级硬件和高并发场景下提高效率的方法。arXiv论文《Lossless but Not Free》对Apple Silicon上的推测解码进行了实证分析,强调加速效果取决于并行验证以及草稿模型和目标模型之间显著的延迟差距。D-Cut论文(也来自arXiv)提出了一种用于批处理推测解码的自适应剪枝方法,该方法优化了并发请求的验证深度,并在MoE模型上显示出显著的加速效果。dev.to的一篇帖子在NVIDIA DGX Spark上对各种推测解码方法进行了基准测试,发现MTP-2在吞吐量和稳定性方面取得了良好的平衡,而DFlash则以较高的峰值和一定的方差实现了高吞吐量。 AI

影响 推测解码的这些进展可能会显著降低LLM的推理延迟和计算成本,使其在消费级硬件和高并发环境中更加易于访问和高效。

排序理由 该集群包含两篇学术论文和一篇技术博客文章,详细介绍了LLM推测解码技术的研究。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →

推测解码研究提升消费级硬件上LLM的推理速度

报道来源 [4]

  1. arXiv cs.AI TIER_1 English(EN) · Param Chordiya ·

    无损但非免费:消费级硬件上投机解码的实证解剖

    arXiv:2607.17283v1 Announce Type: new Abstract: Single-stream autoregressive decoding of large language models is bound by memory bandwidth: each generated token requires one full forward pass through the target model, and successive passes cannot be parallelized. Speculative dec…

  2. arXiv cs.CL TIER_1 English(EN) · Tianyu Liu, Yuhao Shen, Rui Cen, Junhan Shi, Jiebin Zhang, Guangshuo Qin, Hong Liu, Song Liu, Guanghua Yu, Jianchen Zhu ·

    D-cut:用于批处理推测解码的自适应验证深度剪枝

    arXiv:2607.14647v1 Announce Type: new Abstract: Speculative decoding accelerates large language model (LLM) inference without compromising output quality. Recent parallel drafting methods further improve single-request performance by decoupling draft length from drafting latency,…

  3. arXiv cs.CL TIER_1 English(EN) · Jianchen Zhu ·

    D-cut:批量推测解码的自适应验证深度剪枝

    Speculative decoding accelerates large language model (LLM) inference without compromising output quality. Recent parallel drafting methods further improve single-request performance by decoupling draft length from drafting latency, enabling longer drafts and higher mean accepted…

  4. dev.to — LLM tag TIER_1 English(EN) · Kristiyan Stoyanov ·

    本地硬件上的推测解码:在NVIDIA DGX Spark上对N-Gram、MTP、EAGLE3和DFlash进行基准测试

    <h1> Speculative Decoding on Local Hardware: Benchmarking N-Gram, MTP, EAGLE3, and DFlash on the NVIDIA DGX Spark </h1> <blockquote> <p><strong>TL;DR:</strong> We benchmark four speculative decoding methods — N-Gram, MTP, EAGLE3, and DFlash — running <code>Qwen3.5-122B-A10B-hybri…