两篇新研究论文探讨了当前大型语言模型(LLMs)在处理道德推理和对齐方面的局限性。第一篇论文认为,LLM代理缺乏连贯对齐所需的基本“道德能力”,在面对道德困境时其回应存在显著不一致。第二篇论文研究了LLM如何评估感知到的道德主体性,发现虽然人类通常比LLM赋予更多的道德主体性,但在面对道德困境时,人类和LLM都倾向于优先考虑伤害的严重程度和情境的紧迫性,而不是稳定的代理评估。两项研究都表明,当前的LLM架构尚不适合需要真正道德理解或责任的任务。 AI
影响 当前的LLM在道德推理方面表现出显著的不一致性,表明它们尚不具备连贯对齐或有意义的道德决策能力。
排序理由 arXiv上发表的两篇学术论文,讨论了LLM在道德推理和对齐方面的局限性。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →