实体
LogitLens
LogitLens
PulseAugur coverage of LogitLens — every cluster mentioning LogitLens across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI可解释性工具出现特定概念盲点
研究人员发现了一种现象,即“激活神谕者”(AOs),一种用于解释其他AI模型内部状态的模型,可能会出现特定概念的盲点。尽管它们在包含某个概念的数据上进行了训练,但这些AO可能选择性地无法恢复该概念。这种失败并非因为概念在模型表示中缺失,而是由于AO自身读取路径中的问题。这些发现引发了对学习到的可解释性接口可靠性的担忧。
-
激活神谕者可能成为特定概念的反阅读器
研究人员发现,激活神谕者(AOs)——一种旨在解释其他模型内部状态的语言模型——可能表现出特定概念的盲点。当一个AO在一个故意隐藏特定概念的主题模型上进行微调时,该AO可能在该概念的识别上变得不那么有效。这种被称为“特定概念反阅读”的现象,即使在隐藏的概念仍然可以在AO的表示和层中解码的情况下也被观察到。失败似乎源于AO的读出通路,这引起了对学习到的可解释性工具可靠性的担忧。