PulseAugur
实时 17:05:43
实体 Concept Activation Vectors

Concept Activation Vectors

PulseAugur coverage of Concept Activation Vectors — every cluster mentioning Concept Activation Vectors across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_242952 ·

    ExpertLens 框架可视化 MoE 嵌入空间以提高检索可解释性

    研究人员推出 ExpertLens,一个旨在增强信息检索中使用的混合专家 (MoE) 增强密集检索器可解释性的新颖框架。与关注局部特征归因的现有方法不同,ExpertLens 通过可视化嵌入空间并利用概念激活向量提供全局可解释性。这种方法揭示了专家路由如何影响嵌入空间的结构,证明 MoE 集成可以为查询和相关文档带来更明确的几何邻域。

  2. TOOL · CL_187254 ·

    新方法探究 AI L2 口语评估系统中的偏见

    研究人员开发了一种新方法来分析用于第二语言(L2)口语评估的 AI 系统中的偏见。该方法利用概念激活向量(CAVs)来探究像 BERT 和 Whisper 这样的模型如何编码并受到第一语言或年龄等不相关说话者属性的影响。研究还探讨了使用稀疏自动编码器(SAEs)来潜在地提高复杂神经嵌入空间中概念方向的清晰度。研究结果表明,概念的可恢复性和影响高度依赖于模型的架构和表示,这突显了在审计偏见时区分这两个因素的重要性。

  3. TOOL · CL_174313 ·

    新框架使用概念激活向量解释图像相似性

    研究人员开发了一个新的框架,使用自动提取的概念激活向量(CAVs)来解释图像相似性。这种模型无关的方法利用稀疏自编码器(SAEs)来识别驱动图像之间相似性的纹理、形状或颜色等概念。该方法通过概念归因图提供了嵌入空间区域的全局洞察和局部解释,并扩展到群体级别相似性和示例检索。

  4. TOOL · CL_51554 ·

    新方法引导视频世界模型中的物理推理

    研究人员开发了一种称为物理引导的方法来控制视频世界模型的物理推理。该技术使用 VideoMAE 模型特定层中的线性探针的权重向量,该向量被识别为概念激活向量 (CAV)。通过在推理过程中将此 CAV 注入模型的隐藏状态,研究人员可以在不改变模型权重的情况下操纵模型对物理合理性的预测。在 IntPhys 基准测试上的实验表明,这种干预能够可靠地改变模型的判断,证实了物理表示是局部化且可引导的。

  5. RESEARCH · CL_36337 ·

    新框架增强了深度学习概念可解释性的稳定性

    研究人员推出$\alpha$-TCAV,一个旨在提高深度学习可解释性中概念激活向量(CAVs)的统计稳定性和实际效用的新框架。所提出的方法通过用一个平滑的、参数化的函数替换一个不连续的函数,解决了标准TCAV分数的一个基本缺陷,该缺陷可能导致结果不稳定。这种泛化统一了现有的TCAV变体,并为参数调优提供了原则性的指导,有可能以更低的计算成本实现更可靠的概念影响测量。