speculative decoding
PulseAugur coverage of speculative decoding — every cluster mentioning speculative decoding across labs, papers, and developer communities, ranked by signal.
- used by large language model 90%
- used by large-language models 90%
- used by vLLM 70%
- instance of FLASH 70%
- developed by FLASH 70%
- instance of large language model 70%
- developed large-language models 70%
- instance of large-language models 70%
- instance of alphaXiv 70%
- used by Eagle3 70%
- instance of Eagle3 70%
- developed Multi Token Prediction 70%
8 天有情绪数据
-
新方法通过推测解码加速大语言模型推理 · 跟踪 7 个来源
研究人员正在开发新的方法,通过推测解码来加速大语言模型(LLM)的推理速度。DARTree 和 SPADE 是两种此类方法,其中 DARTree 专注于基于树的推测解码,以提高接受长度和加速效果,而 SPADE 则将推测解码集成到边缘和云设备中,以降低成本和延迟。其他相关工作包括 MemSpec,它针对内存受限的边缘设备优化自适应推测解码,以及 Goose,它使用各向异性推测树来提高效率。这些进展旨在使大语言模型的部署更加实用和经济高效。
-
推测性解码走向成熟,加速 LLM 推理
推测性解码是一种加速 LLM 推理的技术,已取得显著成熟,相关框架纷纷采用,用户也报告了令人印象深刻的性能提升。尽管核心概念已存在多年,但其在 2026 年的广泛采用和有效性归功于 Tri Dao 等人的“Speculative Speculative Decoding”论文等突破性进展。一些人认为,这项进展对于本地 LLM 推理的重要性堪比之前的 FlashAttention。
-
Apple 发布 ARBITRAGE 以提高 LLM 推理效率
Apple Machine Learning Research 推出了 ARBITRAGE,这是一个旨在提高大型语言模型 (LLM) 在推理任务中效率的新框架。传统的推测解码方法在推理时常常会因为不必要的拒绝而遇到困难,即使是在步级别也是如此。ARBITRAGE 通过采用一个动态路由系统来解决这个问题,该系统经过训练,能够预测目标模型何时会提供一个显著更好的推理步骤,从而近似一个理想的预言机,以实现最佳的效率-准确性权衡。与现有的步级…
-
推测性解码详解:GPU 硬件限制加速大语言模型推理
本文解释了推测性解码,这是一种利用图形处理器 (GPU) 的物理限制来加速大语言模型 (LLM) 推理的技术。核心思想是,虽然增加矩阵大小会增加计算量,但不会增加模型权重从内存加载的次数。由于加载权重是大语言模型推理的主要瓶颈,因此处理额外的 token 所需的时间极少,使得推测性解码成为一种高效的生成加速方法。
-
Speculative decoding boosts on-device LLM speed by reducing memory reads
Speculative decoding is a technique designed to accelerate the text generation speed of large language models on resource-constrained devices. This method involves a smaller, faster draft model proposing multiple tokens…
-
新的大语言模型研究致力于加速训练、领域适应和推理效率
多篇在 arXiv 上发表的研究论文探索了优化大语言模型(LLM)训练和推理的新方法。A-3PO 提出了一种近似策略优化方法,以加速 LLM 训练;Diffract 通过检查权重矩阵和注意力头来分析领域适应;ZeroLock 引入了一种无反向传播算法,用于内存高效的 LLM 训练;DistillCache 使用强化学习进行推理过程中的自适应 KV 缓存驱逐。其他研究则侧重于通过采样多样性提高 LLM 推理性能,防范针对 KV 缓存的侧…
-
用户寻求帮助在 llama.cpp 中为 DeepSeek V4 Flash 0731 启用推测解码
Reddit r/LocalLLaMA 版块的一名用户正在寻求帮助,以便在 llama.cpp 框架内为 DeepSeek V4 Flash 0731 模型启用推测解码。用户提供了关于其设置的详细信息,包括使用的特定 llama.cpp 构建版本、模型版本和命令行参数。尽管遵循了文档,但在尝试加载启用了推测解码的模型时,他们遇到了初始化错误。
-
推测性解码在不同模型上的性能差异巨大
推测性解码是一种旨在加速 AI 模型推理的技术,但发现在某些条件下会显著降低性能。在 Llama-3-70B 模型上进行测试时,该技术在 batch 224 时成为一种“负担”,将 token 吞吐量降低了 26%。在 gpt-oss-120b 模型上进行的类似测试显示,性能转折点急剧转移到 batch 1,981,表明该功能何时变得有害存在 45 倍的差异。这种不一致性表明,当前关于启用推测性解码的建议可能不完整,因为它通常只引用了…
-
新型攻击导致 AI 推测性解码崩溃,增加推理时间
研究人员开发了一种名为 ADSD 的新型提示后缀攻击,该攻击利用了推测性解码中的漏洞。推测性解码是一种用于加速 AI 模型推理的技术。ADSD 系统性地将草稿模型(draft model)的概率推向目标模型(target model)不太可能接受的 token,导致验证器(verifier)接受率崩溃。这种攻击可以将 GSM8K 等数据集上的推理时间显著增加多达 62.3%,同时仍能保持任务输出的质量。研究人员证明,这种漏洞存在于各种…
-
投机性解码速度提升的谜团在 Apple Silicon 上得到解决
作者调查了旨在加速大型语言模型推理的投机性解码技术为何在 Apple Silicon 上未能实现预期的性能提升。最初的假设集中在 MPS 分派开销和草稿模型的大小上,但两者都被证明只是部分解释或不正确。调查显示,理论上的加速计算并未考虑到实际的硬件成本,并且接受率比预期更具可变性和内容依赖性。作者还注意到实测加速超过理论极限的情况,这表明硬件成本的建模方式存在更深层次的问题。
-
GLM-5.2-FP8-DSpark 部署显示性能提升参差不齐
GPUStack 上的一位社区成员部署了 GLM-5.2-FP8-DSpark,这是 GLM-5.2-FP8 的增强版本,它整合了来自 Red Hat AI 的外部草稿模型的推测性解码。性能测试结果喜忧参半:在单并发场景下,DSpark 提升了 2.2 倍;但在高并发情况下,其表现不如原始模型。研究结果表明,DSpark 目前最适合低并发交互式用例,而非高吞吐量的生产工作负载。
-
新研究通过先进的推测解码技术提高LLM推理速度 · 追踪8个来源
研究人员正在探索先进技术,通过推测解码来加速大型语言模型(LLM)的推理。"Functional Reconstruction"等新方法旨在通过优化注意力函数来提高草稿模型和目标模型之间的一致性,而"SparseSpec-L"则利用动态稀疏化的KV缓存和每头注意力统计数据来提高效率。其他工作重新审视了"lossy verification"以分析权衡和失败模式,并将方法分为基于截断和协作验证。此外,"AngelSpec"为不同的推测解…
-
推理工程:LLM 运营中隐藏的成本驱动因素
推理工程是 LLM 运营中一个关键但常被忽视的层面,通过管理量化、推测解码和 MoE 路由等因素,显著影响成本。FP8 KV 缓存和提示缓存等创新正在涌现,以优化 token 效率并降低费用。例如,一个使用 Claude Sonnet 4.6 的团队每月花费约 4,800 美元,其中模型本身占 960 美元,其余 3,840 美元归因于这一推理层。
-
推测解码研究提升消费级硬件上LLM的推理速度
研究人员正在探索推测解码技术以加速大型语言模型(LLM)的推理。两篇论文,一篇来自arXiv,另一篇来自dev.to,详细介绍了在消费级硬件和高并发场景下提高效率的方法。arXiv论文《Lossless but Not Free》对Apple Silicon上的推测解码进行了实证分析,强调加速效果取决于并行验证以及草稿模型和目标模型之间显著的延迟差距。D-Cut论文(也来自arXiv)提出了一种用于批处理推测解码的自适应剪枝方法,该方…
-
新的EcoSpec框架将MoE大语言模型推理速度提升1.62倍 · 跟踪2个来源
研究人员开发了EcoSpec,一个新颖的成本感知推测解码框架,旨在提高混合专家(MoE)大语言模型的推理效率。该方法通过将预测的边际专家激活成本纳入草稿选择过程,解决了“专家分散”的问题,旨在重用专家并减少内存流量。在DeepSeek-V3.1和Qwen3-235B-A22B等大规模MoE模型上的评估表明,EcoSpec持续减少了活跃专家足迹,并将解码速度提高了1.62倍。
-
新方法通过投机解码加速大语言模型推理 · 跟踪4个来源
研究人员正在开发新的方法,通过投机解码来加速大语言模型(LLM)的推理。例如,AdaFlash 使用 on-policy 蒸馏和自适应长度头来降低方差和验证成本,实现了高达 66% 的吞吐量提升。SpecLA 为线性注意力模型提供了高效的投机解码,速度提升高达 1.70 倍。另一种方法 SpecVocab 使用投机词汇来提高接受长度和吞吐量,而 Progressive Tree Drafting (PTD) 采用引导式并行草稿策略,解…
-
新的推测解码方法提高了 LLM 推理速度和效率 · 跟踪 6 个来源
研究人员推出了 DominoTree,一种新颖的推测解码方法,通过使用条件树状结构显著加速 LLM 推理。该方法在 Qwen3-4B 模型上实现了高达 6.6 倍的加速,并显示出比 DDTree 和 CaDDTree 等现有技术更高的吞吐量。同时,其他研究探索了宽松的推测解码,研究速度和能力之间的权衡,并引入了 AdaptiveSD 以在 CPU 限制下实现鲁棒的、运行时自适应的推理。DSpark 是另一个框架,它将高吞吐量的并行生成…
-
新方法通过自适应解码策略提高 LLM 推理速度
研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。
-
KV Cache 内存解析:估算和减少 LLM 中的 VRAM 使用量
KV Cache 是 LLM 推理的关键组成部分,会消耗大量 VRAM,尤其是在更长的上下文长度或更大的批处理大小时,其占用内存常常超过模型权重所需的内存。一个简单的公式可以估算 KV Cache 内存:2 × layers × hidden_dim × context_length × bytes_per_param。例如,Llama 3.1 70B 在 128K 上下文下,其 KV Cache 需要 340GB。像多查询注意力(M…
-
DFlash 通过并行令牌块草拟加速 AI 推理 · 跟踪 2 个来源
加州大学圣地亚哥分校的研究人员开发了 DFlash,这是一种新颖的推测性解码技术,可显著加速 AI 推理。与一次生成一个令牌的传统方法不同,DFlash 使用块扩散模型在单次传递中提出整个令牌块。然后,一个更大的目标模型并行验证这些块,从而实现显著的加速。这种方法在 NVIDIA Blackwell GPU 上对 GPT-OSS 120B 等模型显示出高达 15 倍的吞吐量,对于长上下文推理和编码任务尤其有利。