一篇新研究论文提出了大型语言模型(LLM)拆分联邦微调(SFF)中的“深度-性能困境”。该困境表明,虽然SFF中更深的 模型分区可以提高系统效率和隐私性,但会导致微调质量灾难性下降。该研究测试了从GPT-2到Llama 3-8B的模型,发现标准的联邦学习聚合方法无法解决此问题,并将性能下降归因于Transformer固有的拓扑结构和称为“注意力崩溃”的现象。 AI
影响 挑战了关于LLM微调效率和稳定性的假设,可能需要新的分布式训练架构方法。
排序理由 详细介绍LLM微调新现象的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Attention Collapse
- Depth-Performance Dilemma
- federated learning
- GPT-2
- Large Language Models
- Llama 3-8B
- Split Federated Fine-tuning
- Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →