研究人员开发了一种名为QUADS的新技术,通过使用NVFP4低精度格式来稳定混合专家(MoE)大语言模型的强化学习(RL)。他们发现,激活误差而非权重误差是MoE模型FP4 RL不稳定的主要原因。QUADS通过在训练器端实现不对称量化感知训练,并在回滚端实现残差激活补偿来解决此问题,达到了BF16级别的准确率并提高了吞吐量。 AI
影响 这项研究通过允许使用低精度格式而不牺牲准确性,有望实现更高效的大语言模型训练。
排序理由 这是一篇研究论文,详细介绍了一种稳定MoE LLM中强化学习的新技术。[lever_c_demoted from research: ic=1 ai=1.0]
- E2M1
- FP8
- Hugging Face
- Large Language Models
- Mixture-of-Experts
- NVFP4
- QUADS
- reinforcement learning
- W4A4
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →