用户创建并分享了 DeepSeek V4 Flash 模型的量化版本,专门针对 DwarfStar (DS4) 推理引擎进行了优化。这些 GGUF 文件旨在提供比标准 llama.cpp 实现更快的性能,一位用户报告在 MacBook M5 Max 上速度超过 30 tokens/秒。创建者正在寻求用户的反馈,特别是拥有 CUDA 或 ROCm 硬件的用户,以帮助改进量化并可能提高性能和去审查等功能。 AI
影响 为 DeepSeek V4 Flash 的本地推理提供了更快的速度,可能改进代理工作流程和可访问性。
排序理由 用户为特定推理引擎生成的现有模型的量化和分发。
- DeepSeek
- GGUF
- MXFP4
- V4 Flash
- CUDA
- DeepSeek-V4 Flash
- DSpark
- DwarfStar
- Hugging Face
- llama.cpp
- Metal
- MTP Head
- ROCm
- antirez
- Unsloth
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →