实体
transcoders
transcoders
PulseAugur coverage of transcoders — every cluster mentioning transcoders across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新理论解释了视觉 Transformer 如何为抽象概念打下基础
研究人员提出了一种称为“转喻电路”的新机制,以解释在训练数据缺乏直接指代证据的情况下,视觉 Transformer 如何为“愤怒”等抽象概念打下基础。该机制表明,抽象预测是由具体的、可解释的锚定概念(如“火”)驱动的,这些概念将视觉信号桥接到抽象语义。使用 Transcoders 在 CLIP 和 DINO 视觉编码器上进行的实验揭示了结构化的转喻电路,其中早期层的感知原语之后是抽象目标之前的类对象锚定。因果干预证实了这些转喻中间体在…
-
转码器用于检测Qwen3-4B语言模型的欺骗行为
研究人员开发了一种使用转码器分析语言模型欺骗行为的新方法,特别关注Qwen3-4B模型。这种被称为机制可解释性(MI)的方法构建了归因图,以映射特征激活和依赖关系,揭示欺骗行为如何从模型内部机制中产生。该研究确定了与欺骗相关的特征,这些特征显著影响模型输出,表明转码器可以帮助监控和检测AI系统的安全漏洞。
-
新的解释器方法提高了数据偏移下AI模型的可解释性
研究人员开发了一种几何自适应解释器(GAE),旨在提高字典式可解释性方法在模型遇到分布外数据时的忠实度。GAE解决了由分布偏移引起的失调问题,分布偏移会旋转模型激活的活动子空间,从而导致解释器字典失调。通过仅使用无标签的分布外数据将字典与分布外活动子空间重新对齐,GAE在无需梯度更新的情况下增强了因果忠实度,其性能与现有的基于训练的方法相当或更优。