DFlash2
PulseAugur coverage of DFlash2 — every cluster mentioning DFlash2 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的 Ninfer 4080 系统可在 16GB 显卡上实现 100k 上下文 LLM
一位软件工程师开发了 Ninfer 4080,这是一个旨在 RTX 4080 显卡(16GB 内存)上运行 ISTA-DASLab-Qwen-3.8-27B-GSQ 模型的系统。该新系统旨在显著提高预填充和 token 生成速度,在 100k 上下文长度下,预填充速度最高可达 2720 token/秒,生成速度可达 262 token/秒。该项目已在 GitHub 上分享,利用了 DFlash2 推测解码,并旨在优化硬件利用率,超越通用推理引擎。
-
NCP-ArchPreview模型通过概念预测推进语言建模
研究人员推出了一种新颖的潜在空间语言模型NCP-ArchPreview,它超越了传统的下一个词元预测。该模型集成了下一概念预测(NCP),使其能够学习和预测跨越多个词元的离散概念。该模型拥有89亿参数,在Dolma-3数据集的5.73万亿词元上进行训练,仅使用了51.3%的训练词元就达到了OLMo-3-7B的预训练损失,并在下游任务上取得了显著的提升,包括在GSM8K上提高了5.99个百分点。
-
4 位量化使大型 AI 模型能够在单块 3090 GPU 上运行
一位 Mastodon 用户分享了他们使用 4 位量化运行 AI 模型的积极体验,指出一块 3090 GPU 可以完全容纳具有 128k 上下文窗口的模型和 DFlash2 模型。他们报告了令人印象深刻的生成速度,即使在大型上下文下也始终高于每秒 38 个 token,在较小上下文下峰值可达每秒 65 个 token。这促使他们考虑将 GPU 升级到 48GB 内存以获得更好的性能。
-
Qwen3.8 27B模型通过新的MXFP4优化达到280 tok/s
一位开发者通过在双R9700 GPU上实现MXFP4内核,显著提升了Qwen3.8 27B模型的性能。据报道,这项利用W4A8量化的优化已经超越了FP8的性能,并将硬件推向了极限。该开发者已开源其工作,促进了社区协作和该领域的进一步发展。
-
llama.cpp 集成 DFlash2 以提升本地 LLM 性能
llama.cpp 项目已集成 DFlash2 的支持,这是一种增强局部卷积和候选选择的新技术。此合并由 SubSir 贡献,标识为 Pull Request #27342,现已成为 ggml-org/llama.cpp 存储库的一部分。此次更新旨在提高本地大型语言模型的性能和能力。
-
DFlash2 推测解码技术提升了 Qwen3.8-27B 在消费级 GPU 上的速度
一位 Reddit 用户分享了在消费级硬件上优化 Qwen3.8-27B 大语言模型性能的指南。该方法称为 DFlash2 推测解码,它将一个较小的“草稿”模型与主模型配对以预测 token,从而显著提高生成速度。据报道,该技术在配备 16GB 显存的 RTX 4080 上,将吞吐量从每秒 50.6 个 token 提高到 86.7 个 token,同时显存使用量仅略有增加。
-
Alibaba Qwen 为 Qwen3.8-27B 模型发布新食谱,支持 NVFP4 和 DFlash2
Alibaba 的 Qwen 团队为其 Qwen3.8-27B 模型发布了新食谱,集成了 NVFP4 和 DFlash2 技术。这些食谱现已在 SGLang 食谱中提供,为用户提供了实验的起点。该团队表示,未来还将为 Qwen3.8-27B 模型提供进一步的更新。
-
vLLM 发布 0.28.0rc2 版本,引入 DFlash2 性能增强
vLLM 发布了 0.28.0rc2 版本,引入了 DFlash2 系统。此次更新结合了局部卷积方法和候选选择器来提高性能。该版本包含 khluu 的贡献。
-
DFlash2 优化将 Qwen 3.8-27B 模型速度提升高达 4 倍
一种名为 DFlash2 的新优化技术已集成到 llama.cpp 中,显著提高了 Qwen 3.8-27B 模型的性能。基准测试显示,DFlash2 平均可将解码速度提高高达 3 倍,某些任务的提升高达 4 倍。这种改进是通过加速模型处理特定部分来实现的,但具体的性能提升可能因任务的复杂性而异。
-
DFlash2 在 Qwen3.8 27B 上显示速度提升但内存使用增加
一位用户在 RTX 5090 GPU 上使用 Qwen3.8 27B 模型测试了 DFlash2,这是一种加速大型语言模型推理的新方法。虽然 DFlash2 显示出速度提升,尤其是在代码生成方面,在短时间内可达 200 tokens/秒,但它也比 MTP 等先前方法更占用内存。用户指出,内存使用量的增加限制了上下文窗口的大小,尽管性能有所提高,但可能使其在特定用例中不太实用。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…