研究人员开发了一种名为COncept ConcentrAtion (COCA) 的新方法,以提高大型语言模型 (LLM) 的安全对齐。COCA重构训练数据,以简化有害和良性表示之间的决策边界,从而能够更有效地线性擦除不安全的概念。实验表明,COCA在保持数学和代码生成等任务性能的同时,显著降低了越狱成功率。 AI
影响 通过提高在不影响其他任务性能的情况下移除有害概念的能力,增强了LLM的安全性。
排序理由 该集群包含一篇详细介绍LLM安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →