task arithmetic
PulseAugur coverage of task arithmetic — every cluster mentioning task arithmetic across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
机器遗忘技术降低了音频语言模型的隐私风险
研究人员开发并评估了几种用于语音问答大型音频语言模型(LALMs)的机器遗忘策略。这些方法包括梯度上升、任务算术和基于对齐的微调,旨在从LALMs中移除敏感信息,同时保留其核心语音理解和问答能力。实验表明,这些遗忘技术可以将隐私泄露显著降低高达80%,同时对非私有语音问答和通用语音理解任务的性能影响极小。
-
CoMerge框架使用偏好优化来优化LLM合并 · 跟踪到2个来源
研究人员推出CoMerge,一个通过参数合并优化多任务大型语言模型的新框架。该方法将合并重构为偏好优化问题,利用朴素合并技术的缺陷作为负样本,在无需外部标注的情况下优化合并系数。实验表明,CoMerge在MergeBench基准测试中表现优越,并能在Llama 3.1 8B-Instruct等模型上增强指令遵循和安全性等特定能力,同时优化最少数量的系数。
-
新方法解耦AI模型特征,以改进多任务合并
研究人员开发了一个新颖的框架,用于将多个AI模型合并成一个更强大的通用模型。该方法通过使用稀疏自编码器将任务向量投影到高维稀疏特征空间,来解决任务特定特征纠缠的“叠加”挑战。为了优化此过程,采用了分组排序的零阶优化器来识别关键的合并层。在Qwen2.5模型上的实验表明,与现有的合并技术相比,在包括一个具有挑战性的四任务场景中取得2.78%的显著提升在内的各种任务上都有显著改进。
-
模型合并技术在新的 IsoLoCo 方法中增强了分布式学习
研究人员探索了使用模型合并技术来改进分布式学习方法(如 DiLoCo)中的聚合。通过将本地 SGD/DiLoCo 中的伪梯度聚合与基于任务算术的模型合并进行类比,他们确定 Iso-C 是一种有前景的方法。他们提出了 IsoLoCo,该方法通过 Nesterov 动量对 Iso-C 进行调整以进行分布式训练,与标准的 DiLoCo 相比,性能有了显著提高,尤其是在工作节点数量增加的情况下。
-
新框架压缩任务向量,实现可扩展的AI知识迁移
研究人员推出了一种名为Task Vector Bases的新型框架,旨在压缩任务算术中使用的任务向量的大型集合。该方法通过将任务向量表示为一组较小的基向量的线性组合,从而降低了存储和计算需求。该框架理论上保证了加法泛化的保持,并实现了有原则的遗忘,其误差界与重建质量相关。实证结果表明,所提出的基构造方法优于启发式基线,并且在各种应用中甚至可以媲美完整任务向量集的性能,同时提供显著的效率提升。
-
新方法合并微调模型以实现多任务学习
两篇新的研究论文提出了将多个微调模型合并成一个多任务模型的方法,以解决任务间干扰的挑战。第一篇论文介绍了Essential Subspace Merging (ESM) 和 ESM++,它们识别并融合负责任务特定更新的关键参数子空间。第二篇论文提出了Concrete Subspace Learning,这是一种元学习方法,用于寻找一个共同的低维子空间,在不显著损失性能的情况下跟踪干扰。这两种方法都旨在通过管理任务特定参数更新之间的冲突…
-
新研究探索AI模型合并优化的先进技术 · 跟踪3个来源
研究人员正在开发新的模型合并优化方法,这是一种将多个专业AI模型的能力结合成一个更强大的模型的技术。一种方法侧重于创建代理基准来有效地调整合并超参数,从而降低与大型语言模型相关的计算成本。另一种方法PACT解决了现有基于任务向量的合并的局限性,通过保留预训练权重中嵌入的关键知识,从而在各种基准测试中提高性能。第三种技术METIS通过采用迭代的、感知损失的多样本合并协议来解决事后合并中的信息擦除问题,以增强多任务性能。