研究人员引入了一个名为Supervised Safe-Role Fine-Tuning (SSRFT)的新框架,以改进大型语言模型 (LLM) 的安全对齐。与专注于明确拒绝模式的传统方法不同,SSRFT将安全重新定义为预定义安全角色的内化。该方法使用源自心理测量问题和有限越狱提示的安全角色问答数据集来合成角色一致的响应。实验表明,SSRFT能够实现更稳健且可泛化的安全对齐,减少过度拒绝并保留模型能力。 AI
影响 这种新的SSRFT方法有望带来更可靠、限制性更小的AI安全措施,从而改善用户体验和信任度。
排序理由 该集群包含一篇详细介绍LLM安全对齐新方法的论文。
- arXiv
- Hugging Face
- Large Language Models
- Reinforcement Learning from Human Feedback
- Safe-Role Internalization
- Safe-Role Question-Answer
- SSRFT
- Supervised Fine-Tuning
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →