一位用户在 AMD 7900 XTX GPU 上对 Google 的 Gemma 4 模型进行了基准测试,比较了标准量化与感知量化训练 (QAT) 版本的性能。结果表明,QAT 版本在各种模型尺寸(包括 12B、26B 和 31B 参数)下,提供了显著的速度提升和更低的显存占用,同时没有牺牲输出质量。具体而言,与标准的 Q8_0 版本相比,12B QAT 模型展示了 45% 的更快生成速度和 83% 的更高吞吐量,同时保持了相同的质量。 AI
影响 感知量化训练为更高效的本地 LLM 部署提供了一条途径。
排序理由 现有模型的用户生成基准测试结果。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →