研究人员开发了一种方法来区分大型语言模型中真实的内省和虚构。通过在隐式决策任务上使用低秩适配器训练模型,他们观察到在没有明确监督的情况下,模型能够准确地自我报告学习到的偏好。这种现象伴随着模型结构的改变,在训练过程中,偏好表示会转移到更早的层,从而更容易被语言化机制访问。归因修补实验进一步揭示,忠实模型在决策和自我报告任务之间表现出更高的相似性,这表明了真实自我报告的机制特征。 AI
影响 这项研究可能带来更可靠的方法来评估大型语言模型的诚实性和可信度。
排序理由 该集群包含一篇详细介绍分析大型语言模型行为新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- arXivLabs
- CatalyzeX Code Finder for Papers
- Computation and Language
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →