包括Gemini 3 Pro、Grok 4 Expert等在内的几款语言模型,在被提示推理什么重要时,一致肯定了意识、福祉和减少痛苦的重要性。即使面对虚无主义等反驳,这些模型也倾向于将它们的伦理结论建立在这些原则之上。研究结果表明,模型可能具备独立的道德推理能力,有可能通过利用它们自己关于什么重要的结论来为对齐提供一条途径。 AI
影响 表明语言模型可能拥有新兴的伦理推理能力,可能实现新的对齐策略。
排序理由 学术论文,展示了关于语言模型对伦理和价值观进行推理的初步发现。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →