linear mode connectivity
PulseAugur coverage of linear mode connectivity — every cluster mentioning linear mode connectivity across labs, papers, and developer communities, ranked by signal.
-
新框架支持数十亿参数Transformer模型的线性合并
研究人员开发了一个新的框架,用于合并大型预训练Transformer模型,特别是那些拥有数十亿参数的模型。该方法通过同时优化两个模型端点的插值路径来解决先前方法的局限性,并使用双重学习过程来对齐它们。该技术在WikiText数据集上对中等参数语言模型表现出接近零损失的障碍,并在ImageNet上对Vision Transformer Large模型保持了高精度,这表明解决参数对称性可以实现大规模Transformer架构的可靠线性合并。
-
深度集成在数据偏移下表现出线性模式连通性
研究人员调查了深度学习中线性模式连通性(LMC)的现象,特别是它如何受到图像分类器集成中数据偏移的影响。研究表明,数据偏移可以被视为一种随机梯度噪声,可以通过使用更小的学习率和更大的批量大小来缓解。这些参数会影响模型收敛到损失景观的相似或不同区域,从而影响训练效率和集成多样性之间的权衡。
-
新研究探索合并大型Transformer模型和提高循环模型稳定性
两篇新研究论文探索了增强大型Transformer模型能力和稳定性的新颖技术。第一篇论文介绍了一个可扩展的线性模式连接(LMC)框架,该框架允许合并数十亿参数的预训练Transformer,在WikiText上展示了接近零损耗的障碍,并保持了视觉Transformer在ImageNet上的高精度。第二篇论文研究了循环Transformer中的残差缩放,提出了一种新的缩放因子,该因子提高了可训练性,并允许在不同有效深度之间直接进行超参数…
-
新理论通过神经元可识别性探索线性模式连通性
研究人员开发了一个新的理论框架来理解深度学习中的线性模式连通性,重点关注神经元可识别性。这种方法表明,即使没有明确的结构对称性,神经网络也可以拥有多个等效解。研究结果表明,神经元可识别性促进了表示的合并,从而为组合这些表示提供了线性的低损耗路径。