实体
Activation Oracles
Activation Oracles
PulseAugur coverage of Activation Oracles — every cluster mentioning Activation Oracles across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
AI可解释性工具出现特定概念盲点
研究人员发现了一种现象,即“激活神谕者”(AOs),一种用于解释其他AI模型内部状态的模型,可能会出现特定概念的盲点。尽管它们在包含某个概念的数据上进行了训练,但这些AO可能选择性地无法恢复该概念。这种失败并非因为概念在模型表示中缺失,而是由于AO自身读取路径中的问题。这些发现引发了对学习到的可解释性接口可靠性的担忧。
-
Anthropic 发布内部 LLM 工作空间 'J-space',支持新的可解释性工具 · 跟踪 9 个来源
Anthropic 发布了一项研究,详细介绍了其 Claude 等语言模型内部的“J-space”,一个内部的“全局工作空间”。该工作空间在处理过程中充当中间变量的无声临时内存,类似于人类认知。一种名为 Jacobian lens (J-lens) 的新工具允许研究人员访问和分析这个 J-space,揭示它在更高阶推理中起着至关重要的作用,尽管它仅占模型整体活动的一小部分。J-space 的存在和 J-lens 的效用已在 Qwen …
-
新的训练方法和评估套件增强了AI模型的可解释性
研究人员开发了一种改进的激活预言家(AOs)训练方案,这是一种用于解释机器学习模型中残差流激活的方法。他们的改进侧重于使用on-policy rollouts、精炼对话数据集、纳入更多层以及优化注入公式。这些变化带来了AOs在生活质量方面的显著提升,并引入了AObench,这是第一个用于AO质量的全面评估套件,旨在为可扩展的端到端可解释性奠定基础。