task arithmetic
PulseAugur coverage of task arithmetic — every cluster mentioning task arithmetic across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
模型合并技术在新的 IsoLoCo 方法中增强了分布式学习
研究人员探索了使用模型合并技术来改进分布式学习方法(如 DiLoCo)中的聚合。通过将本地 SGD/DiLoCo 中的伪梯度聚合与基于任务算术的模型合并进行类比,他们确定 Iso-C 是一种有前景的方法。他们提出了 IsoLoCo,该方法通过 Nesterov 动量对 Iso-C 进行调整以进行分布式训练,与标准的 DiLoCo 相比,性能有了显著提高,尤其是在工作节点数量增加的情况下。
-
新框架压缩任务向量,实现可扩展的AI知识迁移
研究人员推出了一种名为Task Vector Bases的新型框架,旨在压缩任务算术中使用的任务向量的大型集合。该方法通过将任务向量表示为一组较小的基向量的线性组合,从而降低了存储和计算需求。该框架理论上保证了加法泛化的保持,并实现了有原则的遗忘,其误差界与重建质量相关。实证结果表明,所提出的基构造方法优于启发式基线,并且在各种应用中甚至可以媲美完整任务向量集的性能,同时提供显著的效率提升。
-
新方法合并微调模型以实现多任务学习
两篇新的研究论文提出了将多个微调模型合并成一个多任务模型的方法,以解决任务间干扰的挑战。第一篇论文介绍了Essential Subspace Merging (ESM) 和 ESM++,它们识别并融合负责任务特定更新的关键参数子空间。第二篇论文提出了Concrete Subspace Learning,这是一种元学习方法,用于寻找一个共同的低维子空间,在不显著损失性能的情况下跟踪干扰。这两种方法都旨在通过管理任务特定参数更新之间的冲突…
-
新研究探索AI模型合并优化的先进技术 · 跟踪3个来源
研究人员正在开发新的模型合并优化方法,这是一种将多个专业AI模型的能力结合成一个更强大的模型的技术。一种方法侧重于创建代理基准来有效地调整合并超参数,从而降低与大型语言模型相关的计算成本。另一种方法PACT解决了现有基于任务向量的合并的局限性,通过保留预训练权重中嵌入的关键知识,从而在各种基准测试中提高性能。第三种技术METIS通过采用迭代的、感知损失的多样本合并协议来解决事后合并中的信息擦除问题,以增强多任务性能。