Catastrophic interference
PulseAugur coverage of Catastrophic interference — every cluster mentioning Catastrophic interference across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究将LLM中的灾难性遗忘定位到输出嵌入
研究人员发现,大型语言模型中的灾难性遗忘(模型在持续训练中会丢失先前学到的信息)存在于新训练数据中未出现的token的输出嵌入中。这种遗忘是由Adam的二阶矩归一化所放大的持续的、单向的softmax梯度驱动的。为解决此问题,提出的解决方案包括在训练期间增加Adam的epsilon值,特别是针对输出投影层。这一调整在不影响新学习或需要模型特定调优的情况下,显著减少了各种模型大小和系列的遗忘,并补充了现有的基于重放的方法。
-
新的持续学习方法应对AI模型中的灾难性遗忘 · 跟踪4个来源
研究人员正在开发新的方法来应对持续学习中的灾难性遗忘问题,即AI模型在学习新任务时会丢失先前获得的知识。一种名为Multiple Embedding Replay Selection (MERS) 的方法,集成了监督和自监督嵌入,以改进回放缓冲区(replay buffer)的样本选择,在低内存场景下显示出优势。另一种方法CLARE利用基于稀疏性的框架来识别关键的微调参数,提高了可扩展性并减少了任务间的干扰。此外,一种名为DR.WIL…
-
新研究探讨组合持续学习机制以实现语言模型的长时记忆
研究人员引入了一个名为长时记忆的新场景,用于研究语言模型如何在延长时间和多次更新后保留信息。现有的持续学习机制在此挑战面前表现不佳,导致显著的遗忘。该研究提出组合互补机制,如数据、函数和权重锚点,以及LoRA+等低秩分配规则,以保留先验信息并管理后续更新。这种组合方法在保留率方面显示出显著的改进,在三个不同的数据集上的平均保留率从1.2%提高到34.9%。
-
受果蝇启发的人工智能学习不忘;数学家思考人工智能的影响
研究人员开发了一种受果蝇启发的算法,该算法利用稀疏编码实现快速学习而不会发生灾难性遗忘。此外,在2026年于费城举行的国际数学家大会上的一次讨论,探讨了在人工智能时代数学的作用和价值。
-
新的CPR方法用于LLMs,以对抗领域适应中的灾难性遗忘
研究人员开发了一种名为关键点路由(CPR)的新方法,用于解决大型语言模型(LLMs)在领域适应过程中出现的灾难性遗忘问题。CPR通过仅在必要时选择性地调用微调的专家模型来解耦通用能力和领域特定能力,其判断依据是基础模型表现不佳的关键标记。该方法旨在在提高LLM在特定领域的性能的同时,保持其通用知识,并以最小的开销取得了最先进的结果。
-
AI模型通过新的学习框架推动超声分割发展
研究人员开发了用于医学图像分割的新型多任务学习框架,重点关注乳腺和甲状腺超声数据。第一种方法利用符合BI-RADS的形态学先验,通过将病灶特征整合到学习过程中,改进了分割和恶性肿瘤分类。第二个框架UCBound-Net通过利用不确定性引导的边界蒸馏来解决持续学习的挑战,以减轻模型适应新解剖学领域时灾难性遗忘的问题。
-
新研究解决人工智能模型的灾难性遗忘问题 · 已追踪 7 个来源
研究人员正在开发新颖的方法来解决持续学习中的灾难性遗忘问题,即人工智能模型在学习新任务时会丢失先前获得的知识。最近几篇 arXiv 论文提出了不同的方法,包括规范化多模态学习中的模态贡献漂移、采用参数高效门控适应以及利用无梯度进化算法。其他方法则侧重于具有无梯度路由的紧凑型潜在空间适配器,以及在零空间中优化状态空间模型以在顺序任务中保留知识。
-
新方法解决持续学习中的灾难性遗忘问题 · 跟踪8个来源
研究人员正在开发新方法来解决持续学习中的灾难性遗忘问题,即模型在学习新任务时会丢失先前获得的知识。几篇论文提出了新颖的技术,包括可学习的小波激活、技能引导的自适应记忆检索和持续蒸馏学习。其他方法侧重于表示微调、激活加权自适应保留和分组 LoRA 适配器合并,以提高模型的塑性和稳定性。这些进展旨在使模型能够更有效地进行顺序学习并适应不断变化的数据流。
-
新的CDML方法增强了持续步态识别中的隐私和准确性
研究人员开发了代码分集调制层(CDML)来应对生物识别系统(特别是步态识别)中持续学习的挑战。这种新方法旨在保持高准确性的同时,防御成员推断攻击,这是在逐步更新模型的系统中常见的隐私问题。通过采用CDML,系统可以在无需数据重传的情况下整合新知识,从而最大限度地降低计算成本并减轻灾难性遗忘。
-
LiMoDE 提出新颖的两阶段学习方法以实现机器人终身操控
研究人员提出了 LiMoDE,一种旨在提高机器人终身操控能力的新颖两阶段学习方案。该方法在预训练期间利用动态专家混合(MoE)结构来获取先验知识,根据不同短期任务的运动信息激活不同的专家。在适应阶段,采用终身 MoE 适应机制来学习新专家并将其与现有专家结合,从而促进知识转移并减轻灾难性遗忘。在模拟和真实世界任务上的实验表明,LiMoDE 在可训练参数和推理开销适度增加的情况下,能有效增强终身适应性和性能。
-
新研究探究 AI 模型中的灾难性遗忘 · 追踪 4 个来源
三篇新研究论文探讨了持续学习系统中灾难性遗忘的现象,特别是在大型语言模型中。第一篇论文引入了一个受控框架来研究遗忘机制,提出表示强度和特征稀疏性起着关键作用,而不仅仅是叠加。第二篇和第三篇论文(似乎是相同的)在神经切线核(NTK)框架下提供了一个函数空间理论,提出遗忘是低秩的,并集中在特定的输出空间方向。第四篇论文对二十个最先进模型进行了机制分析,识别了脆弱的神经回路,并引入了一种名为低秩电路投影(LRCP)的新干预措施来减轻遗忘。
-
AI通过受睡眠启发的记忆重放实现持续学习
研究人员开发了一种新颖的方法来对抗人工神经网络中的灾难性遗忘,该方法受到生物睡眠过程的启发。这种方法允许AI模型在经历无监督的“类睡眠”重放阶段之前顺序学习多个任务。这种重放有助于恢复先前学习任务的性能,表明特定任务的信息是逐渐衰减而不是立即被覆盖的。
-
新的FBCC方法解决了无监督持续学习的挑战
研究人员引入了一种名为前向后向知识蒸馏持续聚类(FBCC)的新方法,以解决无监督持续学习中的灾难性遗忘问题。该方法使用教师网络学习新聚类,同时保留现有聚类,而无需 past data。在基准数据集上的实验表明,FBCC在聚类准确性方面优于现有方法,并减少了遗忘。
-
研究:强化学习比监督式微调更能保留大型语言模型电路,减少灾难性遗忘
一篇新的研究论文探讨了大型语言模型中灾难性遗忘的现象,特别是比较了强化学习(RL)和监督式微调(SFT)。研究发现,虽然SFT能更快地适应新任务,但它会严重破坏模型的内部电路,并导致先前能力的更大程度遗忘。相比之下,RL能保留更多原始模型的电路,尽管任务适应速度较慢,这表明电路的保留是RL在灾难性遗忘方面具有鲁棒性的关键。
-
新方法无需重新训练即可恢复语言模型丢失的能力
研究人员开发了一种名为DG-Hard的新型事后方法,以解决语言模型中的灾难性遗忘问题。该技术旨在通过分析模型权重更新的光谱特性,在微调后恢复丢失的能力,而无需重新训练。DG-Hard应用奇异值分解过滤步骤,以分离和保留有益的更改,同时去除残余噪声,在各种基准测试中表现出色,甚至恢复了安全对齐。
-
AI持续学习研究应对灾难性遗忘
研究人员正在探索AI持续学习的新方法,旨在克服“灾难性遗忘”的挑战,即模型在学习新技能时会丢失先前学到的信息。Google Research推出了“嵌套学习”,一种将模型视为相互关联的优化问题的范式,以缓解此问题。其他研究侧重于高效方法,如CIRCLE,它使用固定的存储库特征,以及用于LLM的SAE引导激活正则化,它在激活空间而非权重空间中运行。此外,正在开发新的指标来更好地表征遗忘,并提出了CoVON等新型优化器来平衡持续学习系统的…