一篇题为“滞后耦合:内部表征在因果化之前即可被读取”的新研究论文探讨了大型语言模型中内部表征的发展。该研究使用Pythia套件和OLMo-2,发现虽然模型在训练早期就可以从其内部状态中“读取”目标变量,但它们“写入”信息以对输出产生因果影响的速度要慢得多。这种被称为“滞后耦合”的现象表明,表征的形成可靠地领先于因果读取的巩固,并警示不要仅仅根据探针准确性来推断可控性。 AI
影响 表明LLM发展中存在一个根本性的瓶颈,即内部理解先于可控输出,这影响了我们如何解释和引导模型。
排序理由 研究论文,详细介绍了关于模型内部表征的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →