研究人员开发了一个理论框架,用于理解激活修复(activation patching)和权重空间消融(weight-space ablation)之间的关系,这两种方法都用于确定神经网络中的因果责任。该理论在理想化模型和小型Transformer上进行了测试,揭示了这些方法在何种条件下会达成一致,以及何时会产生分歧,特别是关于它们如何衡量模型输出的变化。研究结果表明,虽然激活修复衡量的是激活的对比度,而消融衡量的是绝对水平,这导致了关于组件重要性的不同结论。 AI
影响 为解释神经网络中的因果归因提供了理论基础,可能提高模型的可解释性。
排序理由 学术论文,详细介绍了分析神经网络组件的新理论框架。[lever_c_demoted from research: ic=1 ai=1.0]
- activation patching
- arXiv
- A Theory of Conditional Collapse under Low-Rank Weight-Space Ablations: I. The Single-Block Theory and Synthetic Validation
- Hugging Face
- multilayer perceptron
- Spearman
- weight-space ablation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →