一篇新的研究论文探讨了大型语言模型(LLMs)的道德一致性,发现其伦理推理存在显著的内部矛盾。研究人员在义务论、功利主义和美德伦理方面测试了 GPT、Mistral 和 Llama 等模型,结果显示当情景被重新表述时,大型语言模型经常违反其陈述的道德原则。这种不一致性引发了对人工智能在道德敏感应用中可靠性的担忧,并凸显了生成式人工智能在认知稳定性方面更广泛的问题,影响着人类决策和人工智能对齐的可行性。 AI
影响 凸显了人工智能在道德推理方面潜在的不可靠性,影响了信任和对齐的努力。
排序理由 在 arXiv 上发表的学术论文,讨论了大型语言模型的能力和局限性。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →