研究人员推出了一种新颖的TRACE框架,旨在增强大语言模型(LLMs)在针对特定任务进行微调后的安全对齐。传统方法由于参数更新重叠,难以平衡任务效用和安全性。TRACE通过离线学习安全补丁来解决这个问题,优化补丁以在不显著降低模型在定制任务上性能的情况下恢复安全性。在多个基准测试和模型上的实验表明,TRACE在实现近乎完美的安全性的同时,还能保持与未防御的微调模型相当的效用。 AI
影响 这项研究提供了一种在不牺牲任务性能的情况下恢复微调后大语言模型安全性的方法,有望提高定制模型的部署能力。
排序理由 该集群包含一篇详细介绍大语言模型安全新方法的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →