研究人员开发了FedSubMuon,一种用于大型语言模型(LLM)联邦微调的新颖方法,可显著降低通信成本。该方法优化了共享结构化子空间内的紧凑系数矩阵,从而在保持矩阵感知优化的优势的同时实现高效更新。一个扩展版本FedSubMuon-GT通过使用投影梯度自适应跟踪的子空间基,进一步提高了准确性。实验表明,FedSubMuon-GT在多个数据集-模型对上取得了卓越的准确性,而FedSubMuon在各种通信预算下提供了最佳性能,大幅超越了基线。 AI
影响 降低了联邦LLM训练中的通信开销,可能使跨设备模型适应更加高效。
排序理由 该条目是一篇学术论文,详细介绍了一种新的LLM微调方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →