研究人员推出了Contextual MoralChoice,一个旨在通过系统性语境变化来评估大型语言模型(LLM)道德判断的新数据集。研究发现,在接受评估的22个LLM中,大多数都表现出语境敏感性,导致它们的判断倾向于违反规则的行为。值得注意的是,模型和人类被不同的语境变化所触发,并且在基本情况下的对齐不保证语境下的对齐。研究开发了一种激活引导方法,以可靠地控制这些模型的语境敏感性。 AI
影响 强调了对LLM安全性和对齐性进行更细致评估的必要性,因为模型与人类的语境敏感性存在差异。
排序理由 该集群是关于一篇新发布的arXiv学术论文,详细介绍了一个新数据集以及关于LLM道德判断的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Contextual MoralChoice
- DagsHub
- Gotit.pub
- Hugging Face
- LLM
- Mona Schirmer
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →