研究人员开发了一种名为DLR-Lock的新方法,以防止对开源权重语言模型的未经授权的修改。该技术用深度低秩残差网络替换标准的MLP,增加了反向传播期间的内存使用量,并使微调优化变得复杂。DLR-Lock旨在防御完全了解模型和防御策略的自适应攻击者,同时保留原始模型的能力,这一点已通过在LLM上的实验得到验证。 AI
影响 引入了一种新颖的防御机制,可以在不影响性能的情况下保护开源模型免受未经授权的适应。
排序理由 该集群包含一篇详细介绍模型安全新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →