研究人员推出CORDA,一个旨在评估大型语言模型(LLMs)层级式道德推理能力的新基准。与侧重于可接受答案或避免违规的现有评估不同,CORDA评估LLMs如何优先处理相互冲突的道德原则。该基准使用跨越四个伦理框架的90个道德困境来测试模型在道德优先事项转移时的适应性。对十个指令调优模型的初步测试显示出强烈的义务论偏见,大多数模型优先避免直接人身伤害而非最小化整体伤害,并且在分类伤害避免规则方面比基于结果的比较更可靠。 AI
影响 该基准通过突出LLMs在复杂道德决策中的局限性,有望推动更可控、更符合伦理的LLMs的发展。
排序理由 该集群包含一篇介绍用于评估LLM能力的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →