PulseAugur
实时 05:37:14
实体 activation patching

activation patching

PulseAugur coverage of activation patching — every cluster mentioning activation patching across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_183189 ·

    新理论解释了激活修复与权重空间消融之间的分歧

    研究人员开发了一个理论框架,用于理解激活修复(activation patching)和权重空间消融(weight-space ablation)之间的关系,这两种方法都用于确定神经网络中的因果责任。该理论在理想化模型和小型Transformer上进行了测试,揭示了这些方法在何种条件下会达成一致,以及何时会产生分歧,特别是关于它们如何衡量模型输出的变化。研究结果表明,虽然激活修复衡量的是激活的对比度,而消融衡量的是绝对水平,这导致了关…

  2. TOOL · CL_180537 ·

    大语言模型难以解码主流传统之外的神话知识

    一项新的研究论文调查了 18 个开源大语言模型如何体现和解码神话知识。研究发现,虽然模型可以体现关于宙斯、朱庇特和索尔等神祇的知识,但它们在一致地识别芬兰、斯拉夫、埃及或中国传统等代表性较低的神话中的对应神祇方面存在困难。研究表明,这种失败发生在解码或读出阶段,而不是在初始体现阶段,并且受到提示中使用的语言的影响。

  3. RESEARCH · CL_115254 ·

    新论文揭示AI模型可解释性中的隐藏交互效应

    一篇题为“多重中介的诅咒”(The Curse of Multiple Mediators)的新研究论文探讨了激活打补丁(activation patching)这一机械可解释性主要工具的局限性。该论文认为,用于将因果责任归因于模型组件的激活打补丁,也会捕获依赖于其他组件状态的交互效应。这些交互效应可能导致可解释性研究中的不稳定性以及不准确的结论,正如在GPT-2 IOI电路中所展示的那样。作者提出,这些交互效应并非无关紧要,而是理解…