研究人员正在探索用于大语言模型(LLMs)安全对齐的新颖方法,超越了传统的擦除技术。一种方法将安全视为两个大语言模型之间的非零和博弈,一个攻击者和一个防御者,通过强化学习进行迭代训练。另一种方法提出了一种辩证方法,将“不安全”的知识整合到专门的专家中,并由一个轻量级路由器指导,以确保安全和信息丰富的输出。第三种方法引入了一个可配置的奖励模型,该模型可以适应不断发展的安全规范,在基准测试中无需额外的人工标注即可达到最先进的性能。 AI
影响 这些多样化的方法可能带来更强大、更适应性强的大语言模型安全机制,在不损害安全性的前提下提高其可用性。
排序理由 该集群包含多篇学术论文,详细介绍了用于大语言模型安全对齐的新研究方法。
- Configurable Safety Reward Model (CSRM)
- CoSApien
- DynaBench
- large language models (LLMs)
- AdvGame
- Anselm Paulus
- arXiv
- LLMs
- Maryam Hashemzadeh
- SafeMoE
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →