研究人员开发了CLEAR,一个用于在不牺牲实用性的情况下提高大语言模型(LLM)安全性的新框架。CLEAR使用一种连续潜在适配器路由机制,仅在必要时选择性地应用安全调整,从而防止在良性任务上的性能下降。实验表明,CLEAR在HarmBench等基准测试中显著减少了有害输出,同时在GSM8K等实用性基准测试中保持甚至提高了性能,特别是在应用于LLaMA-3-8B-Instruct等模型时。 AI
影响 这种方法可能带来更安全、更强大的大模型,减少安全性和性能之间的权衡。
排序理由 该集群描述了一篇详细介绍大模型安全对齐新方法的学术论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →