DFlash 2
PulseAugur coverage of DFlash 2 — every cluster mentioning DFlash 2 across labs, papers, and developer communities, ranked by signal.
- 2026-08-18 research_milestone DFlash 2, an updated quantization technique, has been released and is available for Qwen 3.8-27B and Muse Glimmer models. 来源
-
ik_llama.cpp 增加了 DFlash 2 推测解码和对新模型的支持
向 ik_llama.cpp 项目提交了一个拉取请求,引入了 DFlash 2 推测解码。此次更新还包括通过 HIP、Vulkan 支持 RDNA3 GPU 上的 IQ4_KS 和 IQ4_KT 量化格式,以及 DSpark 的初步实现。该项目还增加了对 Ling-3.0 模型和 Muse-Glimmer 的运行时支持。
-
DFlash 2 在 llama.cpp 基准测试中将 Qwen 3.8 27B 的速度提升了 2.26 倍
一位用户在使用 llama.cpp 中的 DFlash 2 推测解码方法,并以 Qwen 3.8 27B 模型为对象进行了基准测试。结果显示,在没有额外方法的情况下,真实世界的编码提示速度提升了 2.26 倍;与 n-gram 查找表结合使用时,速度提升高达 4.68 倍。基准测试还指出,DFlash 2 比其前代产品需要更少的 VRAM,并且推测解码的某些配置参数表现不如预期。
-
Inco AI 发布 DFlash 2 以加快 LLM 推理速度
Inco AI 发布了 DFlash 2,这是大型语言模型(LLM)投机解码的一项进展。新版本在原始 DFlash 的并行草稿方法的基础上,通过最小的延迟增加,将每次验证的输出提高了 20% 以上。DFlash 2 旨在通过在单次传递中优化 token 预测和选择,来提高推理效率,这是 AI 代理的一个关键瓶颈。
-
DFlash 2 量化技术发布,支持 Qwen 3.8-27B 和 Muse Glimmer
DFlash 2,DFlash 量化技术的更新版本已发布。新版本可用于 Qwen 3.8-27B 和 Muse Glimmer 大型语言模型。DFlash 2 的 GGUF 量化版本已提供,并已向 llama.cpp 项目提交了相应的拉取请求。