在 r/LocalLLaMA 子版块上,用户们正在讨论 DeepSeek V4 Flash 0731 模型的性能。一位用户报告称,在使用四块 RTX 5060 Ti 16GB GPU 和 DDR4 3200 RAM 的配置下,提示处理速度约为每秒 200 个 token,生成速度约为每秒 11 个 token。该性能是通过使用 llama.cpp,并设置 128,000 的上下文窗口和特定的量化设置实现的。 AI
影响 提供了特定模型配置的用户报告基准测试。
排序理由 用户关于模型性能的讨论,而非主要发布或基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →