研究人员开发了一种名为增强模型操纵(AugMP)的新策略,用于攻击大语言模型(LLMs)的联邦微调(FFT)。该方法利用图表示学习识别合法LLM更新中的相关性,然后指导创建恶意更新。一种迭代算法优化这些恶意更新,以嵌入对抗性目标,同时使其看起来与良性更新相似,从而难以检测。实验表明,AugMP可以显著降低全局LLM准确性和本地代理性能,同时规避标准防御机制。 AI
影响 引入了一种新的攻击向量,可能危及通过联邦学习训练的LLM的完整性。
排序理由 详细介绍LLM新型攻击方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →