研究人员开发了一种名为 Four Over Six (4/6) 的新量化方法,以提高 NVFP4 等低精度数值格式在大语言模型中的精度。该技术自适应地将块缩放到更小的 FP4 值,从而减少量化误差,尤其是在接近最大值时。使用 Nemotron 3 Nano 30B-A3B 模型架构进行的实验表明,与现有的 NVFP4 方法相比,4/6 方法能使训练损失更接近 BF16,且计算开销极小。 AI
影响 通过减少内存使用和提高速度,同时将精度损失降至最低,从而提高了大语言模型的效率。
排序理由 详细介绍模型量化新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →