moral foundations theory
PulseAugur coverage of moral foundations theory — every cluster mentioning moral foundations theory across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究发现:LLM转向向量反映人类价值几何 · 追踪3个来源
研究人员正在探索大型语言模型(LLM)中的激活转向技术,作为一种行为控制方法,它提供了对RLHF和DPO等微调技术的替代方案。一项新研究《Steering Geometry: Validating Human Value Geometry in LLM Steering Space》探讨了这些转向向量是否反映了与人类价值观相关的连贯语义结构。研究结果表明,基于分布的转向方法与人类价值拓扑的理论预测一致,而以行为为中心的方法实现了相似的…
-
研究发现:大型语言模型以几何方式构建道德知识
一项新的研究论文探讨了大型语言模型(LLMs)如何组织道德知识,超越了简单的道德内容检测。研究发现,LLMs能够区分不同的道德基础,例如关怀/伤害和公平/欺骗,并在其内部结构中以几何方式表示这些关系。这种道德组织在预训练早期就出现,并反映了语料库的统计特征,而非预定义的理论区分,这表明模型能够表示道德张力和冲突。
-
研究发现:AI道德推理评估遗漏关键方面 · 跟踪2个来源
arXiv上的两篇新研究论文强调了评估AI道德推理能力方面存在的关键差距。第一篇论文认为,当前的评估过于侧重于使AI输出与人类价值观保持一致,而忽略了AI能否正确识别和应用情境敏感的道德规范这一关键方面。它提出了一项研究议程,通过开发规范理论的形式化表示和创建用于规范应用的专家标注数据集来解决这一问题。第二篇论文批评了参与式道德AI方法,即通过聚合人类偏好来训练AI策略。该论文揭示,开发者的特征范围界定、选民抽样和问题措辞选择会显著影…
-
新数据集探索人工智能伦理研究中的道德价态
研究人员提出了一个用于标注自然语言中道德价态的新数据集,旨在通过纳入情感考量,使人工智能更好地符合人类伦理。该数据集包含跨越行为/判断和后果价态的500个标注,源自Commonsense Norm Bank 中的文本情景。初步结果显示,这些价态特征与道德分类之间存在显著关系,使用正则化逻辑回归进行二元分类时,Matthew 相关系数达到了显著的0.764。这项工作表明,纳入价态后果可能有助于实现更符合人类道德的人工智能。
-
新的AI框架通过道德理由增强仇恨言论检测
研究人员开发了一个名为监督道德理由注意力(SMRA)的新颖框架,以提高仇恨言论检测模型的可解释性和鲁棒性。与依赖表面线索或事后解释的先前方法不同,SMRA将源自道德基础理论的道德理由直接整合到训练目标中。这种方法指导模型关注文本中道德上显著的部分,从而产生更具上下文和内在可理解的解释。该框架使用巴西葡萄牙语的新基准数据集HateBRMoralXplain进行了验证,证明在不损害公平性的情况下提高了性能和解释质量。
-
LLM的道德推理通过实用推理方法得到增强
研究人员开发了一种新方法,通过关注实用推理和元实用链接来增强大型语言模型(LLM)的道德推理能力。该方法旨在弥合显式陈述与隐含道德含义之间的差距,并借鉴道德基础理论。在三个不同的道德推理任务上的实验表明,该方法显著提高了LLM泛化其道德推理能力的能力。
-
新基准测试大语言模型构成道德判断的能力
研究人员开发了一个名为“道德电车竞技场”(Moral Trolley Arena)的新基准,用于评估大语言模型如何构成道德判断。该基准超越了对孤立行为的简单偏好排序,评估模型在单一场景中结合多个道德信号的能力。研究对十个前沿模型进行了分析,发现复合道德判断在很大程度上可以由个体行为的强度预测,但并非简单相加,而是被持续压缩,这表明大语言模型存在复杂的道德推理过程。
-
与文化价值观和道德框架对齐的大模型人格
研究人员开发了一种方法,用于创建植根于特定文化价值观的大型语言模型(LLM)人格。然后,使用世界价值观调查和道德基础理论等社会心理学框架对这些人格进行分析。该研究考察了这些合成人格如何与已建立的文化地图和道德反应模式保持一致,为评估 LLM 生成角色的跨文化结构和变异性提供了一种方法。
-
道德基础理论应用于人工智能决策
社会心理学家 Jonathan Haidt 正在探索如何将道德基础理论应用于人工智能。他提出了关于哪些道德原则应指导人工智能决策的问题,并将此与社会心理学和政治意识形态联系起来。