研究人员提出了一个理解语言模型自我修复的新框架,认为对模型组件的干预可以被视为代表反事实对比的坐标轴上的点。这种观点认为,一个固定的系数 $\gamma_r$ 控制着细粒度单元的因果修复响应,决定它们是抵消还是增强被移除的信号。在 Gemma、Qwen、LLaMA 和 Mistral 四个不同的模型家族上进行的实验,识别出许多组件,包括 MLP 和 OV 神经元,它们遵循这种仿射定律,并且 $\gamma_r$ 的大小可以从固定权重中预测。 AI
影响 为理解和潜在控制模型内部动态提供了一个新的理论视角,这可能为未来的模型架构和可解释性研究提供信息。
排序理由 该集群包含一篇详细介绍理解语言模型行为的新理论框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →