研究人员发现,Transformer 模型中从记忆到泛化的转变,即所谓的 grokking 现象,并非由于模块切换,而是现有分布式电路的谱重编码。他们的研究使用“转换游戏”发现,效用增益是分布式的,块 0 注意力和块 1 MLP 中的特定模式起着重要作用。与普遍预测相反,MLP 并非只负责记忆而注意力负责泛化;相反,grokking 过程涉及更复杂的谱重编码。 AI
影响 提供了对大型语言模型如何泛化更深入的理解,可能为未来的架构改进提供信息。
排序理由 详细介绍 Transformer 模型内部工作原理的开创性发现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →