一种名为 ROCmFPX 的新方法已被开发出来,可将拥有 2840 亿参数的 DeepSeek V4 Flash 模型适配到 AMD Ryzen AI MAX+ 395 处理器上的 128 GB 统一内存中。该技术利用了一系列具有不同每权重比特精度的块格式,实现了高效的存储和处理。优化后的模型达到了高达每秒 32 个 token 的解码速率,显著优于先前类似硬件配置的基准测试。 AI
影响 使更大的模型能够在消费级硬件上运行,从而可能提高人工智能开发和部署的可及性。
排序理由 该条目详细介绍了一种在特定硬件上运行大型语言模型的新方法,包括性能指标和量化格式的技术细节。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →