DSpark
PulseAugur coverage of DSpark — every cluster mentioning DSpark across labs, papers, and developer communities, ranked by signal.
- 2026-06-28 research_milestone DeepSeek released the DSpark speculative decoding framework, achieving an 85% boost in generation speed. 来源
- 2026-06-28 product_launch DeepSeek released the DSpark speculative decoding framework to boost AI generation speed. 来源
- 2026-06-27 product_launch DeepSeek and Peking University jointly open-sourced DSpark, a speculative decoding framework that significantly accelerates LLM inference. 来源
- 2026-06-27 product_launch DeepSeek and Peking University jointly open-sourced DSpark, a speculative decoding framework that significantly accelerates AI model inference. 来源
12 天有情绪数据
DSpark's performance boost to be benchmarked against industry standards
With DeepSeek claiming an 80% inference speed boost and an 85% generation speed increase due to DSpark, it is likely that the company will seek to benchmark these improvements against competitors in the AI and semiconductor material sectors to validate their technological advancements.
DeepSeek to leverage DSpark for semiconductor material production efficiency
Given DeepSeek's stated focus on supporting global entrepreneurs in the primary market and its involvement in establishing a full industrial chain for fourth-generation semiconductor materials, it's plausible they will further integrate DSpark to optimize production processes and R&D in this sector.
DSpark update linked to significant inference speed gains in DeepSeek V4
Multiple sources indicate that DeepSeek's V4 model has seen an 80% increase in inference speed following an update to its DSpark system. This suggests a strong correlation between DSpark's capabilities and DeepSeek's performance improvements, particularly in generation speed which is also claimed to be up by 85%.
-
NVIDIA 发布 Nemotron 3.5 Lightning 草稿模型以实现专业化解码 · 跟踪 3 个来源
NVIDIA 发布了 Nemotron 3.5 Lightning 30B-A3B 系列下的新型草稿模型,专为专业化解码任务设计。Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 拥有 8.33 亿参数,可在 H100 和 RTX 5090 等硬件上加速 30B 目标模型以进行 DFlash 解码。另一个变体 Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark …
-
据报道 DeepSeek-V4-Flash 在 DSpark 草稿模型配置下存在性能问题
Reddit r/LocalLLaMA 版块的一名用户在使用 DSpark 草稿模型配置时,发现 DeepSeek-V4-Flash 模型的性能明显低于 Multi Token Prediction (MTP) 设置。MTP 配置可达到每秒 30-40 个 token 的可观速度,而 DSpark 配置则降至每秒仅 1-2 个 token。该用户正在寻求关于如何正确配置 llama-server 的推测解码以解决此瓶颈的建议,并提供了…
-
DeepSeek V4 Flash 正式发布,声称在基准测试中获胜
DeepSeek 已正式发布其 V4 Flash 模型,该公司声称该模型在九项代理基准测试中优于其 V4 Pro 预览版。文章通过检查模型卡和配置文件来验证这些说法,并指出虽然 Flash-0731 确实优于 V4 Pro,但仍不及 Opus 4.8。该版本具有 100 万个 token 的上下文窗口,采用混合专家架构,具有 FP8 密集和 FP4 专家权重,并包含集成的投机解码模块,以提高代理应用中的延迟和成本效益。
-
新研究提升LLM投机解码速度和效率 · 跟踪4个来源
arXiv上发表的四篇新研究论文介绍了增强大型语言模型投机解码的新技术。这些方法旨在提高生成速度和效率,而无需额外的模型训练。技术包括使用验证器计算的语义键、近似最长前缀选择、MoE模型的承诺加权专家集以及半自回归模型的父节点条件草稿树。这些论文共同展示了在包括Qwen3和DeepSeek-V4在内的各种基准和模型尺寸上的显著加速和改进的接受率。
-
Together AI 推出 DeepSeek V4 Flash,以更低成本实现前沿代理性能
Together AI 宣布推出 DeepSeek V4 Flash,该模型旨在显著降低运行前沿代理性能的成本。此次集成通过高吞吐量的生产环境为开发人员提供了支持,可用于编码、工具利用和长期代理工作负载等任务。DeepSeek V4 Flash 具有增强的编码能力、改进的自动化工具使用功能,并支持不同的推理工作量,同时采用 DSpark 投机解码以实现更快的生成速度。
-
用户寻求双 RTX 6000 GPU 的 DSpark 配置帮助
一位 Reddit 用户正在寻求帮助,以配置配备双 RTX 6000 显卡的系统的 DSpark。他们在将 DSpark 与 SGLang 和 vLLM 结合使用时遇到了问题,并且在 DeepSeek 模型方面取得的成功有限,发现禁用 DSpark 时 DeepSeek mxfp4 的效果更好。用户正在寻求他人的指导和成功的配置。
-
DeepSeek V4 Flash 0731 在 TensorSharp 上使用 DSpark 实现了显著加速
一项新的基准测试结果突显了 DeepSeek V4 Flash 0731 在使用 DSpark 和 TensorSharp 推理引擎时的性能提升。在包括短输出和长输出、后续问题以及文档分析在内的各种生成任务中,与未使用 DSpark 的基线相比,DSpark 在令牌处理速度方面始终提高了 1.5 倍到 2 倍以上。TensorSharp 引擎支持本地 GGUF LLM,并具有连续批处理和推测解码等功能,被呈现为一个运行这些模型的开源解决方案。
-
llama.cpp 为 DeepSeek-V4 Flash 添加了 MTP 和 DSpark 支持
llama.cpp 项目已集成对 Multi Token Prediction (MTP) 和 DSpark 的支持,特别是针对 DeepSeek-V4 Flash 模型。此增强功能可实现对更长序列的更有效处理,并可能在某些语言生成任务中提高性能。此次更新通过向 llama.cpp 存储库提交拉取请求完成,使用户能够利用 DeepSeek-V4 Flash 模型的新功能。
-
Unsloth 支持本地运行 Kimi K3 和 DeepSeek-V4 Flash 模型
Unsloth 发布了更新,支持使用 Dynamic GGUFs 在本地运行 Moonshot AI 的 Kimi K3 和 DeepSeek-V4 Flash 模型。这些更新包括针对各种系统的性能增强、错误修复和改进的安装过程。此次发布还澄清,Unsloth 未受近期 Keyv 及相关软件包安全事件的影响,因为它使用的是不同的、未受影响的版本。
-
DeepSeek V4 Flash 为 DwarfStar 推理引擎进行了量化
用户创建并分享了 DeepSeek V4 Flash 模型的量化版本,专门针对 DwarfStar (DS4) 推理引擎进行了优化。这些 GGUF 文件旨在提供比标准 llama.cpp 实现更快的性能,一位用户报告在 MacBook M5 Max 上速度超过 30 tokens/秒。创建者正在寻求用户的反馈,特别是拥有 CUDA 或 ROCm 硬件的用户,以帮助改进量化并可能提高性能和去审查等功能。
-
llama.cpp 集成 DSpark 推测解码以提升性能
一项拉取请求已提交至 llama.cpp 项目,以集成 DSpark 推测解码。此新功能旨在通过允许模型预测未来 token 来提高性能。开发者鼓励用户试用 DSpark 并分享他们的性能统计数据和改进。
-
SGLang 发布 v0.5.16,包含 574 个 PR 和新的 DSpark 算法
SGLang 发布了 0.5.16 版本,这是一个重要的更新,包含来自 169 位贡献者的 574 个拉取请求。此版本引入了 DSpark,一种旨在提高 AI 模型输出置信度的新型推测解码算法。
-
PrismML 发布 Bonsai 27B,一款用于离线移动使用的 27B LLM
PrismML 发布了 Bonsai 27B,这是一款拥有 270 亿参数的大型语言模型,能够离线运行在 iPhone 17 Pro Max 等移动设备上。该模型通过新颖的 1 位训练方法而非传统量化实现了小巧的体积,文件大小为 3.9GB。虽然它在推理和代码生成方面保持了强大的能力,但在工具调用等代理任务方面表现有所下降。Bonsai 27B 可通过浏览器中的 WebGPU 访问,或与 OpenAI 兼容的客户端集成。
-
PrismML 发布 Bonsai 27B,使 Qwen3.6-27B 可在笔记本电脑和手机上运行
PrismML 发布了 Bonsai 27B,这是 Qwen3.6-27B 的高度压缩版本,有 1 位和三元变体。这些模型旨在在笔记本电脑和手机等消费级硬件上运行,其中 1 位版本仅需 3.9GB,三元版本需要 5.9GB。尽管经过了激进的压缩,三元模型仍保留了原始 FP16 模型约 94.6% 的性能,而 1 位版本则保留了 89.5%,使其适用于需要大上下文窗口和高效内存使用的应用程序。
-
DeepSeek 声称 AI 速度大幅提升,实际增益较小
DeepSeek 宣布其 AI 系统速度显著提升,声称得益于其 DSpark 技术实现了 661% 的提升。然而,这一头条数字代表了一个极端场景,即之前的系统在高延迟下失效。在更实际的生产条件下,实际性能增益接近 60-85%。这种效率提升是 DeepSeek 减少每次 AI 请求所需计算资源的更大战略的一部分,可能规避美国的芯片出口限制。
-
新的DeLS-Spec方法通过解耦上下文加速LLM推理
研究人员推出了一种名为DeLS-Spec的新方法,通过解耦长短上下文推测解码来加速大型语言模型推理。该方法使用一个固定的长上下文专家DFlash和一个轻量级的、可独立训练的短上下文专家。与需要从头开始训练的Domino和DSpark等先前方法相比,DeLS-Spec提供了显著更低的训练成本和更高的模块化。在Qwen3模型上的实验表明,DeLS-Spec在各种基准测试中提高了加速效果和平均接受长度。
-
DeepSeek V4 Flash with DSpark 相比 EAGLE 显示出显著的速度提升
一位 Reddit 用户分享了他们使用 SGLang 通过 DSpark 部署 DeepSeek V4 Flash 模型在 HGX-H200 系统上的经验。他们将 DSpark 的性能与 EAGLE 进行了比较,发现 DSpark 的速度明显更快,尤其是在更高的批次大小下。基准测试表明,DSpark 能够在每个步骤中生成更多的 token,从而在接受率略有下降的情况下实现显著的吞吐量提升。
-
新的推测解码方法提高了 LLM 推理速度和效率 · 跟踪 6 个来源
研究人员推出了 DominoTree,一种新颖的推测解码方法,通过使用条件树状结构显著加速 LLM 推理。该方法在 Qwen3-4B 模型上实现了高达 6.6 倍的加速,并显示出比 DDTree 和 CaDDTree 等现有技术更高的吞吐量。同时,其他研究探索了宽松的推测解码,研究速度和能力之间的权衡,并引入了 AdaptiveSD 以在 CPU 限制下实现鲁棒的、运行时自适应的推理。DSpark 是另一个框架,它将高吞吐量的并行生成…
-
AI推理技术旨在降低磁盘溢出性能影响
正在探索dSpark、dflash、MTP和QAT等新的推理加速技术,以减轻大型语言模型溢出到磁盘时出现的性能下降。核心问题是,这些进步能否使磁盘溢出的性能影响更加可容忍,从而有可能在功能较弱的硬件上使用更大的模型。早期讨论表明,虽然这些技术提供了速度提升,但它们在使磁盘溢出技术在实际应用中可行方面的有效性仍不确定。
-
Cognition AI的Devin Fusion降低模型成本;DeepSeek开源DSpark以实现更快的推理
Cognition AI推出了Devin Fusion系统,该系统结合了前沿模型和成本效益高的AI模型,在保持性能的同时将成本降低高达35%。这是通过一个双代理架构实现的,该架构动态地路由任务以优化模型使用。另外,DeepSeek开源了DSpark,这是一个旨在通过预测文本生成路径来将LLM推理速度提高高达85%的框架。