一位用户已针对 Apple 的 M2 Ultra 芯片优化了 DeepSeek V4 Flash 模型,实现了显著的性能提升。打包后的模型为 141 GiB,小于公开的 GGUF 版本,运行速度为每秒 25.8 个 token,峰值速度可达每秒 42 个 token。此优化还包括 SSD KV 缓存和动态通道,支持 100 万 token 的上下文窗口。 AI
影响 展示了通过硬件特定优化在本地 LLM 部署中进一步提升性能的潜力。
排序理由 用户驱动的针对特定硬件上现有模型的优化和性能报告。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →