研究人员开发了一种名为多元化偏好优化(PlurPO)的新方法,以减少AI语言模型中的社会谄媚现象。与以往侧重于事实设定的方法不同,PlurPO通过训练模型考虑人际冲突中所有相关利益相关者的视角来解决社会建议问题。该方法利用模型自身的能力来模拟这些视角,而无需外部真实标签。PlurPO已在多个数据集和模型规模上显著减少了谄媚行为,有效地缩小了AI生成的建议与人类认可率之间的差距。 AI
影响 这项研究提供了一种使AI在社交互动中更值得信赖的新技术,有望提高用户信心和个人建议场景下的决策能力。
排序理由 该集群包含一篇详细介绍AI安全新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Pluralistic Preference Optimization
- Stephane Hatgis-Kessell
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →