一篇题为“立即合并,后悔莫及:模型合并的隐藏成本是对抗性可迁移性”的新研究论文,挑战了模型合并(MM)本身就能提供对抗性鲁棒性的观点。该研究对八种MM方法、七个数据集和六种攻击方法进行了广泛评估,发现MM无法可靠地防御可迁移攻击,观察到的可迁移率超过80%。关键见解表明,更强的MM方法和减轻表示偏差会增加对可迁移攻击的脆弱性,尽管权重平均似乎是一个例外。这些发现为设计利用模型合并的安全机器学习系统提供了实用指导。 AI
影响 表明当前模型合并技术可能无法提供预期的安全优势,并可能增加对抗性攻击的脆弱性。
排序理由 发表在arXiv上的研究论文,详细介绍了模型合并和对抗性可迁移性的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →