实体
Sparse Autoencoders (SAEs)
Sparse Autoencoders (SAEs)
PulseAugur coverage of Sparse Autoencoders (SAEs) — every cluster mentioning Sparse Autoencoders (SAEs) across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
揭示了用于深度神经网络的新型可解释OOD检测方法
研究人员开发了一种新颖的方法来检测深度神经网络中的分布外(OOD)数据,特别针对医疗成像应用,因为在这些应用中可靠性至关重要。这个新框架利用稀疏自编码器(SAEs)学习特定类别的概念向量,然后用这些向量来扰动模型表示。在这些语义扰动下预测的稳定性可作为OOD检测的指标,同时提供区分信号和对模型不确定性的可解释视图。
-
语言模型神经元被发现是稀疏的,有助于可解释性
研究人员已经证明,语言模型MLP层内的神经元表现出的稀疏度与稀疏自编码器(SAE)相当。这一发现使得开发用于电路追踪的基于梯度的管道成为可能,从而能够识别出具有因果效应的神经元。该方法已成功识别出约100个MLP神经元组成的电路,用于控制模型在主谓一致任务上的行为,并揭示了用于多跳城市-州-首都任务的推理步骤的特定神经元集,在没有额外训练成本的情况下推进了自动化可解释性。