PulseAugur
实时 11:42:29
English(EN) Sparse Weight Decomposition for Efficient Circuit Extraction

新方法从密集Transformer中提取可解释电路

研究人员开发了稀疏权重分解(SWD)方法,这是一种从密集预训练Transformer模型中提取可解释电路的新颖方法。与需要额外训练或引入保真度差距的先前方法不同,SWD将权重矩阵分解为稀疏分量,从而无需重新训练即可直接进行电路分析。该技术在性能上可媲美或超越现有方法,同时使用的资源(数据和计算)却显著减少。SWD已在GPT-2、Qwen2.5和Qwen3.5-27B等多种模型上证明了其有效性,并提供了一种零数据变体,以实现更广泛的机械可解释性应用。 AI

影响 为大型语言模型实现更高效、更易于访问的机械可解释性。

排序理由 该集群包含一篇详细介绍Transformer模型分析新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法从密集Transformer中提取可解释电路

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Chuanhao Yan, Xuhan Huang, Yawen Duan, Zhenfei Yin, Hang Zhao, Bryan Dai, Jie Fu ·

    Sparse Weight Decomposition for Efficient Circuit Extraction

    arXiv:2608.03913v1 Announce Type: cross Abstract: Dense pretrained transformers do not naturally expose interpretable units for circuit extraction. Existing approaches obtain such units by learning auxiliary sparse representations or training sparse models, incurring substantial …