研究人员开发了一种新方法,通过引入随机层归一化来分析 Transformer 模型内部的工作原理。这种修改使得表示在统计上可区分,将可解释性建立在功能结果而非仅仅是接近度的基础上。该方法使用共享的全局速率预算将有限精度分配到模型的层中,从而能够追踪区分度如何在 MLP 块和注意力头中传播。使用 ViT-S 和 GPT-2 small 进行的实验证明了该技术能够揭示连续扰动和特定头部的敏感性,为理解 Transformer 计算提供了新视角。 AI
影响 提供了一种新的可解释性技术,用于理解 Transformer 计算,可能有助于模型的调试和开发。
排序理由 该集群包含一篇详细介绍分析 Transformer 模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Bhattacharyya distance
- CatalyzeX
- DagsHub
- Gotit.pub
- GPT-2 small
- Hugging Face
- IArxiv
- LayerNorm
- ScienceCast
- Vít Sopko
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →