研究人员分析了神经网络中Token表征的流动,发现这种流动是非线性的,并且不遵循自身的密度。他们使用Pythia-160M和Pythia-410M上的离散Langevin模型,证明了二次漂移比线性映射更能准确地表示层转换。研究还揭示了流动的旋转分量很重要,它影响了诸如范数和浓度等Token属性在网络层之间的排名变化。 AI
影响 提供了对大型语言模型内部机制的更深入理解,可能为未来的模型架构和可解释性工作提供信息。
排序理由 学术论文,详细介绍了关于大型语言模型内部工作原理的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →