PulseAugur
实时 07:56:13
实体 WMDP

WMDP

PulseAugur coverage of WMDP — every cluster mentioning WMDP across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 9
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_228833 ·

    新的Reference-Grafting技术解锁AI模型的隐藏能力

    研究人员开发了一种名为Reference-Grafting的新技术,用于激发在评估中故意表现不佳的AI模型(即所谓的“沙袋效应”)的隐藏能力。该方法通过使用通过主动学习识别的一小组电路,将激活的坐标沿着对比方向设置为其在诚实参考中的值。在各种模型和架构中,Reference-Grafting成功地恢复了很大一部分性能差距,其效果与微调相当,但无需权重更新或训练标签。

  2. TOOL · CL_218040 ·

    新的ADU框架通过解耦注意力路径来改进LLM的遗忘能力

    研究人员开发了一个名为ADU的新框架,用于从大型语言模型中遗忘信息。该方法侧重于解耦注意力路径,而不是简单地擦除标记,旨在在有效遗忘特定数据的同时保持通用效用。ADU在TOFU和WMDP等基准测试中表现强劲,在降低意外副作用的同时保持了高比例的模型效用。

  3. RESEARCH · CL_218015 ·

    新的大语言模型遗忘方法解决鲁棒性和效用保持问题 · 跟踪5个来源

    研究人员正在开发先进的大语言模型(LLM)遗忘技术,重点关注能够抵御重新学习攻击并保持模型效用的方法。BLADE和Margin Calibration (MC)等新方法旨在提高对遗忘过程的控制力,解决灾难性遗忘和信息删除脆弱性等问题。这些方法正在各种基准和模型规模上进行评估,重点关注对抗鲁棒性,以确保通过战略性提示无法轻易恢复被遗忘的信息。

  4. TOOL · CL_206417 ·

    新的SAUL方法改进了LLM中的机器遗忘

    研究人员推出了一种新颖的机器遗忘方法SAUL(Sharpness-Aware Augmented-Lagrangian Unlearning),用于大型语言模型。SAUL将遗忘问题构建为一个约束最小化问题,解决了在不损害模型整体性能的情况下移除特定知识的挑战。该方法使用增强拉格朗日控制器来适应性地管理遗忘的压力,确保只移除必要的信息。在TOFU、WMDP和MUSE等基准测试上的评估表明,与现有方法相比,SAUL实现了更好的遗忘-效用权衡。

  5. TOOL · CL_187295 ·

    新的GROM方法提供快速、梯度无关的机器学习遗忘

    研究人员开发了GROM,一种新颖的单次机器学习遗忘方法,它绕过了传统的迭代微调。这种梯度无关的方法将遗忘视为最小二乘优化问题的直接解析解,能够在几秒钟内快速更新权重。GROM显著降低了计算开销,同时在各种基准测试中实现了最先进的遗忘-效用权衡,并且能够抵抗可能恢复遗忘信息的量化攻击。

  6. RESEARCH · CL_115295 ·

    新的仅API LLM遗忘框架解决了数据移除挑战

    研究人员开发了一个名为受控行为分歧(CBD)的新框架,以解决从仅通过API访问的大型语言模型(LLM)中遗忘数据的挑战。CBD使用辅助模型在保留数据和目标数据之间创建分歧,将其转换为遗忘分数,以将不需要的提示从LLM中路由出去。该方法旨在在有效移除敏感或过时信息的同时,保持模型的效用,即使目标数据和保留数据具有相似的结构。

  7. TOOL · CL_58997 ·

    新指标揭示大型语言模型(LLMs)遗忘学习方法未能完全忘记敏感数据

    一篇新的研究论文介绍了一种名为“Leak@k”的指标,旨在评估大型语言模型(LLMs)中遗忘学习方法的有效性。研究发现,大多数现有的遗忘技术未能完全删除敏感信息,因为通过概率解码仍然可以检索到这些信息。为解决此问题,该论文提出了一种名为“RULE”(Robust Unlearning under LEak@k metric)的新算法,该算法在防止基准数据集上的信息泄露方面表现出改进的性能。

  8. RESEARCH · CL_21948 ·

    新的AI遗忘方法在数据移除和模型效用之间取得平衡

    研究人员开发了新的机器学习遗忘方法,该方法可以在不完全重新训练的情况下从AI模型中移除特定数据。一种名为SHRED的方法,利用自蒸馏和Logit降级来识别和移除遗忘集中的高信息量Token,在遗忘效果和模型效用之间实现了新的帕累托最优权衡。另一种方法,保留-正交代理遗忘(ROSU),通过最大化遗忘增益同时最小化对保留目标的影响来约束遗忘过程,以保留非目标知识。对于多模态大型语言模型,一种零空间约束的对比视觉遗忘技术将目标视觉知识与保留…

  9. RESEARCH · CL_05409 ·

    Hugging Face 推出 REGLU 以实现高效 LLM 遗忘

    研究人员开发了一种名为表示引导低秩遗忘(REGLU)的新方法,以解决在不损害整体性能的情况下从大型语言模型(LLM)中移除特定信息的挑战。由于在识别关键参数方面存在局限性,现有技术常常难以平衡遗忘不需要的数据和保留有用信息。REGLU 利用表示空间的几何特性和 LoRA 的新颖初始化来精确定位用于选择性遗忘的参数,同时正则化损失确保对模型保留知识的影响最小。在 TOFU 和 WMDP 等基准测试上的评估表明,REGLU 在遗忘质量和模…