研究人员开发了Cat-DPO,一种用于对齐大型语言模型与人类偏好的新算法。该方法将安全对齐视为每个类别的约束优化问题,从而解决了在有用性和安全性之间取得平衡的挑战。与使用单一标量进行安全性的先前方法不同,Cat-DPO为每个危害类别采用了单独的自适应安全裕度,使其能够更好地跟踪特定类别的难度并降低不同类型有害内容的安全性表现的方差。 AI
影响 这种新的安全对齐方法可能带来更鲁棒和细致的LLM行为,降低跨不同类别的有害输出的风险。
排序理由 该集群描述了在arXiv上的学术论文中提出的一种新算法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →