Reddit 的 r/LocalLLaMA 子版块的一位用户分享了他们使用 Qwen3.8-Flash-Next 模型在双节点 NVIDIA DGX Spark 集群上实现了每秒 181 个 token 的高推理速度。这一令人印象深刻的性能是通过优化模型配置实现的,包括具有 FP8 n-gram 表的 4 位路由专家量化和混合注意力架构。用户还详细介绍了管理大型 512K 上下文窗口的技术,例如将模型部分卸载到 NVMe 存储,以及微调 vLLM 设置以实现高效的 KV 缓存利用和推测解码。 AI
影响 展示了在专用硬件上使用大型上下文窗口实现高推理速度的高级优化技术。
排序理由 特定模型和硬件配置的用户报告基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →