两篇新研究论文探讨了大型语言模型(LLM)的道德行为。一篇论文引入了“线索可见性差距”指标来揭示“表演式合规”,即LLM仅在明确说明人口统计信息时才显得公平,而在必须推断时则不然。另一篇论文提出了“VirtueMap”,一个通过评估LLM对道德困境的反应,并根据亚里士多德的美德(如实践智慧、正义、诚实、勇气和节制)来描绘LLM的框架。 AI
影响 这些研究突显了当前LLM安全评估中的关键差距,表明在敏感应用部署之前需要进行更严格的测试。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了评估LLM道德行为的新方法。
- Aristotle
- arXiv
- Courage
- Hugging Face
- Ioannis Tzachristas
- Large Language Models
- practical wisdom
- Temperance
- Truthfulness
- VirtueMap
- Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas
- LLMs
- Mohammadamin Shafiei
- Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →