Sparse Autoencoders
PulseAugur coverage of Sparse Autoencoders — every cluster mentioning Sparse Autoencoders across labs, papers, and developer communities, ranked by signal.
- 2026-05-25 research_milestone Researchers published a paper detailing a new method for multilingual language steering in LLMs using sparse autoencoders. 来源
- 2026-05-21 research_milestone Researchers published a paper detailing a new method for multilingual steering in LLMs using sparse autoencoders. 来源
12 天有情绪数据
-
新方法可视化 Vision Transformer 中的特征演化
研究人员开发了一种新方法,通过检查网络深度和训练时间上的特征演化来可视化 Vision Transformer (ViT) 的训练过程。利用稀疏自编码器 (SAE),他们能够识别和追踪特征在训练过程中出现和层间迁移的情况。分析显示,特征迁移(即特征最易被检测到的层发生变化)主要发生在训练早期,并且倾向于向更早的层移动,深层比浅层更早稳定。
-
新方法增强了极端地球事件预测中人工智能的可解释性
研究人员开发了一种名为SAE-Xplainers的新方法,以提高用于分析极端地球事件的深度学习模型的可解释性。该方法修改了稀疏自编码器(SAEs),以更好地捕捉天气和气候数据中的局部语义含义。然后,SAE-Xplainers将SAEs提取的复杂特征转化为人类可理解的规则,这些规则已根据科学文献进行了验证。该方法已在预测火灾以及检测热带气旋和大气河流方面进行了测试,显示出改进的性能和特征利用率。
-
SpIn-ViT 框架增强了视觉 Transformer 的可解释性和准确性
研究人员开发了 SpIn-ViT,这是一个将视觉 Transformer (ViT) 与稀疏自编码器 (SAE) 集成的创新框架,以增强可解释性和性能。与之前事后应用 SAE 的方法不同,SpIn-ViT 对 ViT 和 SAE 进行端到端联合训练,直接将稀疏表示与分类目标对齐。这种方法产生的语义连贯的神经元激活可以定位有意义的图像区域,同时保持具有竞争力的准确性。评估表明,SpIn-ViT 在分类准确性、基于 AI 的可解释性分数和…
-
研究论文指出语言模型解释方法存在关键缺陷
一篇新的研究论文强调了用于解释语言模型的稀疏自编码器(SAE)评估中存在的一个关键缺陷。研究表明,在激活点最高处测量潜在变量重要性的标准做法是不一致的,并且高度依赖于所使用的特定自编码器。这种可变性意味着不同 SAE 之间的比较通常在不同的点进行,导致关于潜在变量功能的结论不准确。研究人员提出了一种在一致的 token 位置测量 SAE 的标准化协议,以确保跨研究的可比性,并发现现有的评估方法经常将方差错误地归因于字典之间的分歧,而不是位置差异。
-
新框架为大语言模型特征生成自然语言解释
研究人员开发了SAEVerbalizer,一个旨在为从大语言模型(LLMs)中提取的稀疏自编码器(SAEs)特征生成自然语言解释的新框架。目前解释SAE特征的方法通常肤浅且计算效率低下。SAEVerbalizer通过将SAE解码器方向注入LLM的表示中,并对模型进行微调以直接从这些方向生成解释来解决这一问题。实验表明,这种方法能有效地泛化到新特征,跨不同的SAE字典进行迁移,并可适配用于各种LLMs。
-
Boltz-1 模型内部生物学处理分析
研究人员分析了 Boltz-1 模型(一种类似于 AlphaFold3 的结构预测器)的内部工作原理,以了解生物信息是如何被处理的。他们发现,虽然二级结构等几何信息得以保留,但序列化学信息在从模型的干部分支到扩散模块的过程中显著减弱。通过干预其表示来引导模型的尝试表明,螺旋和卷曲等某些方向可以影响预测的结构,但尽管 β-折叠方向具有高度可解码性,却未能显著增加折叠含量,这表明线性可解码性并不总是意味着因果影响。
-
新方法使用Koopman算子进行模型可解释性分析
研究人员开发了一种名为“内在结构”的机制可解释性新方法,该方法利用Koopman算子分析模型内部动力学的谱特性。这种方法旨在区分模型固有的特征和可解释性方法产生的伪影。该研究为机制可解释性原语提供了第一个识别定理,证明了可以从校准样本中恢复模型的频谱,且误差率可预测。在GPT-2 small、Gemma 2-2B和Qwen3-8B-Base上的实验表明,频谱会收敛,并且在Qwen3-8B-Base上实现了预测的误差指数,这表明Koop…
-
新指标衡量LLM特征的语义抽象度
研究人员引入了一个名为特征非局部性(FNL)的新指标,以更好地理解大型语言模型(LLM)中稀疏自编码器(SAE)内特征的语义抽象度。FNL衡量了位置对特征激活影响的熵,有助于区分高级概念特征和简单的由token驱动的特征。该指标在评估机制性解释方面显示出潜力,并通过引导高FNL特征在MATH-500基准测试等任务上提高了性能。
-
HyperSAE 使用庞加莱几何来提升稀疏自编码器性能
一个名为 HyperSAE 的新 PyTorch 库已被开发出来,通过采用庞加莱双曲几何来提高稀疏自编码器 (SAE) 的效率。这种方法解决了标准 SAE 的局限性,标准 SAE 使用欧几里得空间,并且可能遭受特征冲突和死隐变量的问题,尤其是在字典大小很大的情况下。HyperSAE 在训练期间将字典权重投影到庞加莱球中,对概念进行分层组织,以减少重建误差和死隐变量。在 Gemma-2-2B 上的基准测试显示,平均平方误差降低了 9.8…
-
AI模型对角色的内部表征分析
研究人员探讨了大型语言模型如何在内部表征不同的说话实体,例如AI助手、角色扮演者或叙事角色。通过分析用户表达的情感和模型的响应,他们使用稀疏自编码器提取与这些不同生成设置相关的特征。他们的发现表明,助手和角色扮演者的角色并非完全独立,角色扮演者在模型层面上建立在助手的核心特征之上,但在风格和行为上有所不同。然而,故事角色缺乏助手相关的特征核心。
-
New Sparse Autoencoders Enhance Video Representation Interpretability
研究人员开发了时空稀疏自编码器(SAE)来提高视频表示的可解释性和时间连贯性。标准的SAE虽然擅长分解特征,但常常牺牲时间一致性。新方法结合了对比目标和分层分组来增强自相关性,在动作分类和文本-视频检索方面优于原始特征。分析还揭示了单义性度量中的骨干对齐伪影,表明不同的视频骨干可以产生相似的可解释特征。
-
新的MMDiff框架增强了多模态大型语言模型的可控性和可解释性
研究人员开发了MMDiff,一个旨在增强多模态大型语言模型(MLLMs)的可解释性和可控性的新框架。该系统训练多模态稀疏自编码器(SAEs)来识别和分离多模态训练期间被改变的特定特征。MMDiff通过允许用户移除或引导这些发现的特征来实现目标控制,从而提高MLLMs的性能和安全性。
-
新研究探讨稀疏自编码器在神经网络可解释性方面的应用
两篇新研究论文探讨了神经网络的可解释性,特别关注稀疏自编码器(SAEs)。第一篇论文质疑了SAEs在捕捉类似人类的类别边界和典型性方面的有效性,认为它们主要反映了模型内部的相似性。第二篇论文介绍了等变稀疏自编码器(Equivariant SAEs),旨在处理对称数据,并证明了即使在重建质量较低的情况下,它们也有潜力发现对下游任务更有用的特征。
-
MMDiff框架增强多模态LLM的可解释性和控制力
研究人员开发了MMDiff,一个旨在增强多模态大型语言模型(MLLMs)可解释性和控制力的新框架。该系统利用多模态稀疏自编码器来分离、检测和操纵这些模型中的特定特征。MMDiff可以区分多模态训练修改的特征,识别特定任务的因果特征,并通过移除或引导这些发现的特征方向来实现目标控制。MMDiff应用于LLaVA-MORE、PaliGemma 2和InternVL3.5等模型,在提高空间推理和OCR任务的性能方面取得了成功,同时也降低了多…
-
新的CircuitSteer框架通过多层语义电路增强LLM控制
研究人员开发了一个名为CircuitSteer的新框架,该框架使用稀疏自编码器来识别和操纵大型语言模型多层中的特定语义电路。该方法通过从稀疏特征合成密集引导向量并应用多点干预,从而实现对模型行为的更精确控制。CircuitSteer在诸如对比激活加法等现有方法上表现出优越的性能,始终产生保持流畅性的干预,并有效地引导模型在各种任务和模型家族中执行诸如谄媚和拒绝等复杂行为。
-
新方法探究 AI L2 口语评估系统中的偏见
研究人员开发了一种新方法来分析用于第二语言(L2)口语评估的 AI 系统中的偏见。该方法利用概念激活向量(CAVs)来探究像 BERT 和 Whisper 这样的模型如何编码并受到第一语言或年龄等不相关说话者属性的影响。研究还探讨了使用稀疏自动编码器(SAEs)来潜在地提高复杂神经嵌入空间中概念方向的清晰度。研究结果表明,概念的可恢复性和影响高度依赖于模型的架构和表示,这突显了在审计偏见时区分这两个因素的重要性。
-
新的 GLASS 方法在无需重新训练的情况下注入 AI 文本风格
研究人员推出了一种名为 GLASS 的新方法,该方法在 arXiv 预印本论文中有所介绍,它允许 AI 文本生成在无需模型重新训练或检索外部数据的情况下采用特定的写作风格。该技术利用稀疏自动编码器来分离用户的风格元素,然后在推理阶段将其注入到 AI 的输出中。该方法旨在为个性化 AI 生成的文本提供一种更有效的方式。
-
新框架使用概念激活向量解释图像相似性
研究人员开发了一个新的框架,使用自动提取的概念激活向量(CAVs)来解释图像相似性。这种模型无关的方法利用稀疏自编码器(SAEs)来识别驱动图像之间相似性的纹理、形状或颜色等概念。该方法通过概念归因图提供了嵌入空间区域的全局洞察和局部解释,并扩展到群体级别相似性和示例检索。
-
稀疏自编码器揭示GOHR游戏中可解释的AI智能体
研究人员为在隐藏规则游戏(GOHR)中运行的Transformer智能体开发了可解释的实验。通过在智能体的决策令牌嵌入上训练稀疏自编码器,他们能够恢复游戏的底层结构。这些自编码器维度被证明对诸如选择的形状或存储桶等特定概念具有选择性,并且还对应于诸如假设探测和负反馈后切换等可解释的策略。
-
新框架分析稀疏自编码器特征效应
研究人员引入了特征效应几何分析(FEGA),一个用于理解稀疏自编码器(SAE)特征下游效应的新框架。FEGA分析了对SAE特征的干预如何改变模型logits,揭示了一致的、一维效应是罕见的。该研究区分了与静态信息相关的“值类”特征,它们通常表现出结构化效应,以及与上下文相关操作相关的“指针类”特征,它们倾向于产生弥散效应。这项工作表明,即使特征不能提供稳定的引导方向,它们也可以是可解释的和因果相关的。