加州大学圣地亚哥分校的研究人员开发了 DFlash,这是一种新颖的推测性解码技术,可显著加速 AI 推理。与一次生成一个令牌的传统方法不同,DFlash 使用块扩散模型在单次传递中提出整个令牌块。然后,一个更大的目标模型并行验证这些块,从而实现显著的加速。这种方法在 NVIDIA Blackwell GPU 上对 GPT-OSS 120B 等模型显示出高达 15 倍的吞吐量,对于长上下文推理和编码任务尤其有利。 AI
影响 加速 AI 推理速度,可能降低生成式 AI 应用的成本并改善用户体验。
排序理由 详细介绍 LLM 中推测性解码新技术的论文。
在 Mastodon — fosstodon.org 阅读 →
- DiffuSpec
- GPT-OSS 120B
- NVIDIA
- NVIDIA Blackwell
- Qwen3-coder
- SpecDiff-2
- University of California, San Diego
- Speculative decoding
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →