General Language Understanding Evaluation benchmark
PulseAugur coverage of General Language Understanding Evaluation benchmark — every cluster mentioning General Language Understanding Evaluation benchmark across labs, papers, and developer communities, ranked by signal.
-
SplitLite 方法大幅降低 LLM 微调通信成本
研究人员开发了 SplitLite,一种用于在设备上高效进行大型语言模型 (LLM) 联邦微调的新方法。该方法通过利用训练周期之间激活和梯度残差的低秩结构,解决了分层学习中的通信瓶颈。SplitLite 在不影响 GLUE 等基准测试的模型性能的情况下,实现了通信成本的大幅降低,激活上行链路降低高达 93.5%,总体降低 83.7%。
-
新的LoRA-CRAFT方法大幅减少微调参数
研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。
-
新研究探索用于LLM的优化LoRA微调方法 · 跟踪4个来源
研究人员正在探索优化低秩适配(LoRA)以微调大型语言模型的新方法。一种方法,统一LoRA(ULoRA),引入了一个可预训练梯度初始化的连续体,该连续体可以针对特定任务进行调整,潜在地匹配或超越完全微调的性能。另一种方法,Manifold-LoRA,将LoRA重新表述为流形优化问题,使用无回缩算法来加速训练并提高下游性能。此外,一种相似性度量方法侧重于仅微调最相关的层,在性能损失最小的情况下将可训练参数减少多达50%。最后,一个称为“…