一位用户解决了在四台DGX Spark上运行GLM-5.2 NVFP4模型时遇到的问题,在128K上下文长度下实现了约每秒24个token的吞吐量。该问题涉及推测解码配置中的一个bug,其中草稿模型的KV缓存和元数据被分片,但其注意力机制未能识别这种分片,导致计算错误。通过确保在配置过程中正确复制`decode_context_parallel_size`,修复了此bug,消除了之前上下文长度和速度之间的权衡。 AI
影响 特定模型配置的用户级优化细节,提供了性能调优的见解。
排序理由 关于优化特定模型配置的用户级技术后续跟进。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →