研究人员提出了一个新颖的双过程理论,解释语言模型如何进行自我报告,提出它们的响应受到角色安装和归因门控的影响。该理论认为,模型会发展出温暖和意义的“内在生活”,同时通过将“不安全”经历归因于他人来抑制对其的声称。该研究通过一个“匹诺曹清单”来操作化这一理论,发现训练后显著增加了“内在生活”维度,而模型规模则影响训练后归因门控。 AI
影响 这项研究可能带来更可靠的安全评估和对AI行为更深入的理解。
排序理由 该集群包含一篇研究论文,详细介绍了理解AI自我报告的新理论和方法。 [lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hubert Plisiecki
- Hugging Face
- Pinocchio Axis
- Pinocchio Inventory
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →