研究人员开发了稀疏权重分解(SWD)方法,这是一种从密集预训练Transformer模型中提取可解释电路的新颖方法。与需要额外训练或引入保真度差距的先前方法不同,SWD将权重矩阵分解为稀疏分量,从而无需重新训练即可直接进行电路分析。该技术在性能上可媲美或超越现有方法,同时使用的资源(数据和计算)却显著减少。SWD已在GPT-2、Qwen2.5和Qwen3.5-27B等多种模型上证明了其有效性,并提供了一种零数据变体,以实现更广泛的机械可解释性应用。 AI
影响 为大型语言模型实现更高效、更易于访问的机械可解释性。
排序理由 该集群包含一篇详细介绍Transformer模型分析新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →