一位 r/LocalLLaMA 上的用户分享了包括 DeepSeek V4 Flash、Qwen3.8 Flash Next、Qwen3.8-27B 和 Qwen3.6-35B-A3B 在内的几款新大语言模型的性能基准测试。测试在 NVIDIA DGX Spark 硬件上进行,重点关注运行时间、服务上下文长度和每秒交付的 token 数等指标。Qwen3.8 Flash Next 模型,尤其是在“中等”设置下,取得了最高的 22/24 分,而其“低”设置提供了更好的日常平衡。DeepSeek V4 Flash 展示了强大的输出 token 生成能力,但运行时间显著延长。 AI
影响 为在 DGX 硬件上运行本地大语言模型的用户提供了实用的性能数据,突出了速度、上下文长度和输出质量之间的权衡。
排序理由 用户在特定硬件上对多个大语言模型进行的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →