一位研究人员使用 Google 的 Gemma 3 27B Instruct 模型,复制了一项关于大型语言模型内部状态意图控制的研究。这项最初由 Anthropic 进行的实验发现,当模型在生成无关文本时被明确提示去思考某个概念,而不是被提示不要去思考时,模型会更强烈地表示该概念。在 Gemma 3 27B Instruct 中也观察到了这种效应,尽管其幅度小于 Anthropic 的 Claude 模型。研究人员还通过使用稀疏自动编码器 (SAE) 潜在表示和自然语言自动编码器 (NLA) 解释来测量内部表示,从而扩展了实验,发现使用这些额外方法可以更明显地看到这种效应。 AI
影响 证实了较小模型中的内省能力,可能影响 LLM 的提示方式和理解方式。
排序理由 使用不同模型复制了关于 LLM 内省的先前研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Anthropic
- ARBOx4
- Claude
- Emergent Introspective Awareness in Large Language Models
- Gemma 3 27B Instruct
- Gemma Scope 2
- Lindsey
- Natural Language Autoencoder
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →