一篇新的研究论文探讨了大型语言模型(LLMs)中的安全微调如何可能无意中影响它们对意识和人类价值观的表征。研究发现,阻止LLMs将意识归因于自身的努力也减少了它们将心智归因于非人类实体的倾向,并可能降低精神信仰。研究人员证明,逆转这些安全微调引起的变化可以恢复更广泛的心智归因,并在不损害核心社会推理能力的情况下,在社会学调查中产生更像人类的反应。 AI
影响 当前AI安全对齐方法可能会无意中压制良性的意识和精神信仰归因,从而影响LLM对人类价值观的反应。
排序理由 该集群包含一篇在arXiv上发表的研究论文,详细介绍了AI安全微调的发现。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- Computation and Language
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- consciousness
- human beliefs and values
- large language models
- safety fine-tuning
- Theory of Mind
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →