研究人员开发了 SpIn-ViT,这是一个将视觉 Transformer (ViT) 与稀疏自编码器 (SAE) 集成的创新框架,以增强可解释性和性能。与之前事后应用 SAE 的方法不同,SpIn-ViT 对 ViT 和 SAE 进行端到端联合训练,直接将稀疏表示与分类目标对齐。这种方法产生的语义连贯的神经元激活可以定位有意义的图像区域,同时保持具有竞争力的准确性。评估表明,SpIn-ViT 在分类准确性、基于 AI 的可解释性分数和人类评估方面显著优于最先进的事后 SAE 方法。 AI
影响 增强了视觉 Transformer 的可解释性,有望在计算机视觉领域带来更值得信赖和易于理解的 AI 系统。
排序理由 该集群描述了一篇关于改进 AI 模型可解释性和性能的新型框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- Sparse Autoencoders
- SpIn-ViT
- Vision Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →