speculative decoding
PulseAugur coverage of speculative decoding — every cluster mentioning speculative decoding across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新方法提升LLM推测解码速度和安全性 · 跟踪7个来源
多篇研究论文和一篇博客文章探讨了大型语言模型推测解码的进展,旨在加速文本生成。DLoop、SecureSD、SpecFold、Nucleus Speculative Decoding (NSD) 和 AgSpec 等技术引入了新颖的方法来提高效率和安全性。这些方法侧重于优化验证过程、处理多分支冗余以及调整草稿长度,其中一些方法在保持或增强模型性能和安全性的同时实现了显著的加速。
-
Llama-server 错误报告推测解码时的 logprobs
llama-server 软件中的一个 bug 导致推测解码错误地将生成 token 的对数概率报告为零。此问题会影响各种模型和配置,包括 Gemma 3B,当启用推测解码时。虽然生成的文本看起来正常,但对数概率数据不准确,可能会影响依赖这些值的下游应用程序。这个问题不容易被检测到,因为零对数概率可能自然发生,并且服务器不会指示这些是占位符值。
-
LEAP框架通过推测性行动建议将LLM代理速度提升60%
研究人员开发了LEAP(学习高效行动建议),一种加速大型语言模型(LLM)代理执行速度的新颖方法。LEAP利用一个小型、经过训练的起草模型来生成行动建议,然后由目标LLM代理进行验证。这种方法显著加快了任务完成速度,在不影响任务成功率的情况下,端到端实际时钟时间最多可缩短60%。用于分析推测性轮次而开发的框架占了大部分测量到的加速,并允许对起草模型进行实际的在线训练。
-
新方法提高 LLM 的推测解码效率 · 已追踪 10 个来源
多篇研究论文介绍了增强大型语言模型 (LLM) 推测解码的新方法,旨在提高效率和准确性。DRelay 专注于使用全局上下文修复并行草稿中的早期选择错误,而 DEdit 提出对草稿进行迭代编辑以纠正错误并扩展已接受的前缀。UBTree 结合了 unigram 和 bigram 模型来创建多样化的草稿树,而 LongSpark 开发了一种独立于前缀长度的固定成本并行草稿器。其他方法,如 SEED 重用已验证的上下文表示以加快草稿速度,HA…
-
Mentored Decoding:机器学习增强理论提升LLM推理速度与质量
研究人员推出了一种名为“Mentored Decoding”的新方法,该方法通过借鉴机器学习增强理论来提高语言模型的推理速度和质量。该方法正式定义了有损推测解码,允许偏离目标模型以提高速度,同时可能提高输出质量。论文详细介绍了Mentored Decoding的关键特性,包括其在特定情况下的几何性质以及用于参数查询和分布构建的高效数据结构。
-
如果接受率过低,推测性解码会拖慢大语言模型的速度
推测性解码是一种旨在加速大语言模型推理的技术,但如果配置不当,它会适得其反地降低性能。该方法涉及一个较小的“草稿”模型生成候选 token,然后由较大的“目标”模型进行验证。只有当接受率——目标模型接受的草稿 token 的比例——足够高以抵消草稿模型的计算成本时,这种方法才有效。在一用户的经验中,由于接受率低,一个 32B 的模型速度变慢了 47%,这凸显了根据不同工作负载衡量此接受率并优化草稿长度和模型匹配的重要性。
-
GrowMTP在RL循环中训练草稿头,加速LLM训练
研究人员开发了GrowMTP,一种在强化学习(RL)循环内完全训练用于推测性解码的草稿头的新颖方法。这种方法无需单独预训练草稿头,从而降低了训练成本。GrowMTP利用RL训练期间产生的窄回滚分布和连续监督信号来优化草稿头。在Qwen3-4B、MiMo-7B-SFT和Qwen3.5-4B-Base模型上的实验表明,回滚生成和端到端训练时间均显著加快。
-
新的投机式解码方法提高了LLM推理速度 · 跟踪7个来源
研究人员正在推进大型语言模型的投机式解码技术,以提高推理速度。两篇新的arXiv论文,ECHO和LoopSpec,分别引入了分层和流水线方法来优化草稿候选生成和验证。ECHO使用早期层奖励logits进行快速草稿探索,而LoopSpec则利用循环Transformer中的中间状态进行流水线草稿生成。另一篇关于Orthrus的论文质疑了投机式解码的“无损”声明,强调了数值精度对输出一致性的影响,而另一项关于Carryover Draft…
-
SpecGuard 使用推测解码技术免费检测 LLM 后门
研究人员开发了 SpecGuard,一种在推理过程中检测大型语言模型后门的新颖方法。该技术重新利用了通常用于加速模型生成的推测解码过程,以识别恶意行为,而无需额外的计算成本。SpecGuard 利用草稿模型预测与目标模型验证过程之间的差异来检测触发的后门,即使是那些设计隐蔽的后门。
-
新研究通过NVM量化和设备端功耗扩展解决LLM效率问题
两篇新研究论文探讨了提高大型语言模型(LLM)效率的方法。第一篇论文《面向长上下文LLM解码的密集片上NVM的接口感知KV缓存量化》提出了一种针对非易失性存储器(NVM)接口优化的量化方案,旨在降低LLM解码的能耗和元数据开销。第二篇论文《PELM:通过推测性解码和动态电压频率调整实现设备端LLM推理的功耗优化》介绍了PELM系统,该系统结合了推测性解码和动态电压频率调整(DVFS)以提高设备端LLM推理的功耗效率,展示了显著的速度提…
-
vLLM 为 AMD GPU 添加推测解码,提升推理速度
vLLM 已为 AMD GPU 实现了推测解码,这是一种通过让一个较小的草稿模型提出标记,然后由一个较大的目标模型进行验证,从而实现更快推理的技术。此功能针对使用 ROCm 平台的 AMD Instinct MI300X 和 MI355X GPU 进行了优化,可带来显著的速度提升,基准测试显示某些模型的吞吐量最高可提高 30%。与 NVIDIA GPU 相比,该实现的目的是提供更具成本效益的扩展解决方案,并通过消除对自定义 CUDA …
-
新方法通过推测性解码提升大语言模型推理速度
研究人员正在开发用于加速大语言模型(LLM)推理的先进推测性解码技术。一种名为 X-CoSD 的方法,通过处理词汇差异和最小化数据传输,专注于设备上小型模型与大型服务器模型之间的有效通信。另一种名为 Osprey 的方法,利用预训练的小型语言模型作为草稿生成器,通过轻量级过程将其适配到各种目标模型,以提高接受率和令牌生成速度。此外,正在探索一种名为在线草稿协同训练(Online Draft Co-Training)的技术,通过优化注意…
-
蒸馏模型中观察到推测性解码,引发了对 n-gram 集成的疑问
一位 Reddit 用户在运行蒸馏模型时观察到了推测性解码的实际应用,注意到可预测的短语被瞬间生成。这一观察引发了关于将推测性解码与 n-gram 相结合的疑问,类似于 n-gram 如何驱动自动建议,以期提高效率。
-
新研究提升LLM推测性解码的速度和准确性
多篇研究论文正在探索大型语言模型(LLMs)推测性解码的进展,旨在提高推理速度和输出质量。一种名为SpecPV的方法通过对关键值状态进行部分验证,在长上下文生成任务上实现了高达6倍的加速。另一种方法,熵感知令牌拒绝(EASD),通过检测和拒绝不确定的令牌预测来提高推理质量,有时甚至超越目标模型本身的性能。其他研究则解决了批处理推测性解码中的锯齿张量问题,并引入了感知验证的训练技术来优化草稿模型。
-
ik_llama.cpp 增加了 DFlash 2 推测解码和对新模型的支持
向 ik_llama.cpp 项目提交了一个拉取请求,引入了 DFlash 2 推测解码。此次更新还包括通过 HIP、Vulkan 支持 RDNA3 GPU 上的 IQ4_KS 和 IQ4_KT 量化格式,以及 DSpark 的初步实现。该项目还增加了对 Ling-3.0 模型和 Muse-Glimmer 的运行时支持。
-
AsymSpec框架通过非对称解码提升Agentic LLM效率
研究人员推出了一种新颖的非对称推测解码框架AsymSpec,旨在提高Agentic大型语言模型(LLM)的效率。该方法通过允许一个轻量级起草器处理完整上下文,而一个更大的验证器处理压缩视图,从而解决了准确性-推理成本的权衡问题。AsymSpec使用对比logit融合和感知差异的门控机制来保持准确性和稳定性,实现了显著的吞吐量提升和计算成本降低。
-
ResiSpec框架提升LLM推测解码效率
研究人员推出ResiSpec,一个旨在提高大型语言模型(LLM)推测解码效率的新框架。推测解码通常使用一个较小的模型来预测未来token,然后由主LLM进行验证。然而,可能会出现一种称为“残差漂移”的现象,即被拒绝的候选会导致模型预测发生分歧,从而导致昂贵的重采样。ResiSpec通过在验证过程中重塑提议分布来解决这个问题,有效地锚定残差目标质量,防止候选过时。与现有的多候选推测解码技术相比,该方法已证明可提高高达1.92倍的速度。
-
ResiSpec框架提升LLM推测解码效率
研究人员推出ResiSpec,一个旨在提高大型语言模型(LLM)推测解码效率的新框架。推测解码通常使用一个草稿模型来预测未来token,然后由一个更大的模型进行验证。然而,多候选方法可能会遇到“残差漂移”问题,即早期候选的拒绝会导致后续候选的分布发生偏离,从而导致低效的重采样。ResiSpec通过在验证过程中重塑提议分布来解决这个问题,将残差目标质量保持在草稿模型的高置信度区域内。据报道,该方法在不牺牲输出准确性的情况下,与现有的多候…
-
新研究探索用于大型语言模型推测性解码的并行草稿
两篇新研究论文探讨了大型语言模型推测性解码的进展,重点关注提高并行草稿的效率和连贯性。第一篇论文调查了块并行推测性解码在多模态模型中的适用性,分析了各种架构和基准。第二篇论文介绍了 LiLiCorr,这是一种轻量级方法,通过关联并行草稿的似然性来增强连贯性和接受率,展示了比现有方法显著的吞吐量改进。
-
新方法通过推测解码加速大语言模型推理 · 跟踪 7 个来源
研究人员正在开发新的方法,通过推测解码来加速大语言模型(LLM)的推理速度。DARTree 和 SPADE 是两种此类方法,其中 DARTree 专注于基于树的推测解码,以提高接受长度和加速效果,而 SPADE 则将推测解码集成到边缘和云设备中,以降低成本和延迟。其他相关工作包括 MemSpec,它针对内存受限的边缘设备优化自适应推测解码,以及 Goose,它使用各向异性推测树来提高效率。这些进展旨在使大语言模型的部署更加实用和经济高效。