PulseAugur
实时 10:57:52
English(EN) Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

新的防御方法保护大语言模型免受恶意微调

研究人员引入了一种名为梯度免疫的新型防御机制,旨在保护已对齐的大语言模型免受恶意微调。该方法通过使用零空间立方层和逆向适配器实现,作为单向安全门(USG),即使在开放权重发布设置中大多数权重仍可训练的情况下,也能保持模型安全。USG通过识别校准保护区域内的隐藏状态,有效阻止来自有害数据样本的梯度,从而在保留安全样本效用的同时,保持微调后较低的攻击成功率。 AI

影响 这项研究可以显著增强开放权重LLM的安全性,使其更能抵抗对抗性攻击和滥用。

排序理由 该集群包含一篇详细介绍LLM安全新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的防御方法保护大语言模型免受恶意微调

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yuxuan Huang, Xingyu Zeng, Tianhang Zheng, Chaochao Lu ·

    梯度免疫:零空间对恶意微调的抵抗

    arXiv:2608.05045v1 Announce Type: cross Abstract: Released aligned large language models remain vulnerable to malicious downstream finetuning. Existing defenses are largely designed for the fine-tuning-as-a-service (FTaaS) paradigm or rely on downstream users to follow additional…