一篇新的研究论文提出了一种拒绝教师(Ref-Teacher)引导的微调框架,旨在增强大型语言模型(LLMs)在通过微调即服务(FaaS)进行定制时的安全性和性能。该方法直接使用安全对齐的拒绝教师的指导来微调基础大型语言模型,该教师会过滤用户数据中的有害提示,并在微调过程中将安全性蒸馏到模型中。实验表明,这种方法比先创建安全对齐权重然后对其进行微调的传统方法更有效,能够减少有害输出并提高用户特定任务的效用。 AI
影响 增强了定制化FaaS环境下的LLM安全性和实用性,可能降低与有害微调相关的风险。
排序理由 详细介绍LLM安全新方法的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Finetuning-as-a-Service
- harmful finetuning attacks
- large-language models
- Ref-Teacher
- Refusal-Teacher
- Seokil Ham
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →