Sparse Autoencoders
PulseAugur coverage of Sparse Autoencoders — every cluster mentioning Sparse Autoencoders across labs, papers, and developer communities, ranked by signal.
- instance of Saessolsheim 90%
- used by Vision Transformers 90%
- used by Gotit.pub 80%
- developed by Gotit.pub 70%
- used by Saessolsheim 70%
- used by UniPro 70%
- developed by Vision Transformers 70%
- used by GPT-2 small 70%
- used by InternVL3.5 70%
- used by CatalyzeX Code Finder for Papers 70%
- instance of Linear Representation Hypothesis 60%
- affiliated with GPT-2 small 50%
- 2026-05-25 research_milestone Researchers published a paper detailing a new method for multilingual language steering in LLMs using sparse autoencoders. 来源
- 2026-05-21 research_milestone Researchers published a paper detailing a new method for multilingual steering in LLMs using sparse autoencoders. 来源
9 天有情绪数据
-
新的可解释性方法揭示了 AI 天气模型 GraphCast 的内部变量
研究人员开发了一种方法,通过训练稀疏自编码器 (SAE) 来解释 GraphCast 等 AI 天气模型的内部工作原理。这些 SAE 被用于揭示 GraphCast 中学习到的概念,重点关注大气河流。研究发现,尽管大气河流强度不是模型的输入或目标,但 GraphCast 将其计算为一个稳定的内部变量。该技术可以识别内部变量并确认其在模型预测中的因果作用,为理解这些模型在气候变化条件下如何表示现象提供了途径。
-
研究发现,大型语言模型表现出比人类更强的幻觉模式感知能力
一篇新的研究论文探讨了大型语言模型(LLMs)中的幻觉模式感知现象,发现这些模型比人类更倾向于从随机数据中推断有意义的关系。该研究将心理学范式改编应用于LLM任务,揭示了模型会过度将积极属性与多数群体相关联,并从模糊事件中构建因果叙事。研究人员开发了一个使用稀疏自编码器的特征可解释性框架来分析内部表征,将整体频率感知和分析性认知导向与这些幻觉感知联系起来。研究结果表明,一种类似认知的幻觉可能会影响LLM推理的可靠性。
-
数字光遗传学:LLM控制与可解释性的新框架
一个名为“数字光遗传学”的新概念提出,将生物光遗传学的原理应用于大型语言模型(LLM),以提高其可解释性和控制性。该方法旨在创建一个能够映射LLM内部概念的系统,类似于大脑中的位置细胞功能,然后在推理时通过激活或抑制特定特征来进行精确干预,类似于使用光来控制神经元。提出的“Opto-Map”层将提供一个实时仪表板,用于观察和调整模型行为,从而在无需重新训练的情况下解决幻觉和偏见等问题。
-
Vision Transformer Token在语义与背景表示方面显示出专业化
研究人员调查了自监督Vision Transformer (ViTs),例如DINOv2中特定Token类型的功用。通过在寄存器Token和高范数异常Patch Token上训练稀疏自编码器,他们发现寄存器Token与高级语义概念的联系更紧密,而异常Token则与背景和纹理模式相关。因果消融实验证明了显著的功能不对称性,破坏寄存器衍生的特征会导致表示相似度大幅下降,而破坏异常衍生的特征则不会。
-
新研究探讨稀疏自编码器的特征可解释性和层级结构
两篇新研究论文探讨了稀疏自编码器(SAEs)的可解释性和结构。第一篇论文介绍了BeFOND,一个统一了SAEs推理和字典学习的模型,提高了在语言模型中检测稀有特征和识别概念的能力。第二篇论文提出了一个严格的评估协议,用于评估SAEs是否学习到了有意义的概念层级,发现虽然SAEs为层级结构提供了基础,但特征吸收可能会损害其质量。
-
新 DiDAE 方法通过更快的反事实来解决基础模型漏洞
研究人员推出了一种名为解耦扩散自编码器(DiDAE)的新方法,旨在解决基础模型中的漏洞,例如虚假关联和“聪明汉斯”策略。DiDAE 将一个冻结的基础模型与一个条件扩散解码器集成,通过闭式编辑实现反事实的创建。这种方法比现有方法快得多,速度提高了 2000 倍,并通过反事实知识蒸馏(CFKD)在修复下游分类器方面显示出有效性。该框架可通过开源的 Peal 库进行访问。
-
稀疏自编码器赋能基础模型的视觉科学发现
研究人员开发了一种使用稀疏自编码器(SAEs)从基础模型中识别和排序视觉特征的方法,无需预先指定的概念即可实现科学发现。该方法在三个阶段进行了测试:一般概念再发现、领域特定概念再发现和驱动式特征排序。在ADE20K、FishVista和Heliconius butterflies等数据集上的评估中,与k-means聚类、PCA和SemiNMF等传统方法相比,SAEs在揭示模型表示中的语义结构方面表现更优。
-
新研究解决AI中奖励模型的不稳定性和效率问题
研究人员正在开发新方法来改进用于大型语言模型和扩散模型中的奖励模型的训练和鲁棒性。一种名为“密度感知奖励聚合”(DARA)的方法,通过根据奖励的活动密度对其进行加权来解决多奖励强化学习中不均衡的学习进展问题,从而在工具调用和数学推理等任务上实现更快的收敛。另一个研究重点是缓解奖励模型中的偏好不稳定性,例如使用稀疏自编码器(SAEs)识别和抑制导致矛盾判断的脆弱特征。针对视频理解,已创建了一个新的基准(VURB)和数据集(VUP-35K…
-
新方法改进视觉-语言模型中的有害表情包检测
研究人员开发了新方法来改进视觉-语言模型对有害表情包的检测。一种方法“Decodable but Misrouted”使用稀疏自编码器和因果干预来识别模型失败是源于证据缺失还是现有证据的路由不当,在 Gemma-3 和 Qwen3.5 等模型的准确性方面取得了显著改进。另一个框架 SyRHM 通过将任务分解为语义检索和符号推理来增强零样本检测,从而能够对有害意图进行更具可解释性的分析,并在基准数据集上取得了卓越的性能。
-
新框架PhysSAE增强了物理信息神经网络的可解释性
一个名为PhysSAE的新框架已被开发出来,用于物理信息神经网络(PINNs)的机制可解释性。该框架使用过完备稀疏自编码器来分析PINNs的内部表示,揭示它们如何编码物理特征。研究表明,PhysSAE可以识别这些特征并对其进行因果干预,表明发现的表示是稀疏的、具有物理结构并且可以在事后进行探究。
-
MonoTM框架通过可解释的特征增强主题建模
研究人员推出了一种新颖的框架MonoTM,旨在通过提取可解释的单义特征来增强主题建模。该方法将文档-主题混合物的估计与主题的语义解释分开,允许为每个任务优化不同的稀疏自编码器(SAE)配置。通过使用完整的SAE表示进行混合估计,并使用一组独立的语料库基础语义特征作为主题描述符,MonoTM旨在在为下游分析保留全局主题结构的同时,提供比传统的基于词的方法更有意义的语义单元。
-
新方法增强大语言模型遗忘能力,以提高安全性和实用性
研究人员开发了新的大语言模型(LLM)机器学习遗忘方法,旨在移除不需要的知识同时保持模型效用。一种方法是动态稀疏自编码器护栏(DSG),它使用动态特征选择和分类器来实现比现有方法更优的遗忘-效用权衡,并提供更高的效率和可解释性。另一种方法是“只忘记重要的,通过遗忘层”(FOM-UL),它专注于层级遗忘,通过识别对要遗忘数据影响大且对保留数据敏感度低的Transformer层。这种有针对性的策略增强了遗忘能力、效用保持能力以及对训练后量…
-
新理论量化神经网络特征叠加的限制
研究人员开发了一个新的理论框架来理解神经网络中的特征叠加,解决了交叉特征干扰的问题。通过将线性可达性建模为压缩感知问题,他们推导出了高概率界限,表明所需的维度与概念的数量成线性比例关系,这比以前的二次界限有了显著改进。这些发现为线性表示假设提供了量化理解,并为评估稀疏自动编码器和神经可解释性等技术提供了基础。
-
研究探究多语言大语言模型中的刻板印象表征
一篇新研究论文调查了刻板印象如何在多语言大语言模型(LLMs)中显现。该研究比较了诸如Llama-3.1-8B、Qwen3-8B和Gemma-2-9B等模型上的线性探测和稀疏自编码器等多种方法,以了解刻板印象相关信息在何处表示以及它如何影响输出。研究结果表明,在这些模型中,探测器的性能峰值远早于归因,并且一小部分特征表现出语言无关的影响,但没有一个是完全类别无关的。
-
Gemma-2-9B-IT模型展示了语言无关的非正式语域
研究人员在Gemma-2-9B-IT模型中识别并控制了一个语言无关的非正式语域。他们使用稀疏自编码器(SAEs)对英语、希伯来语和俄语进行了分析,发现了一个强大的跨语言非正式语言核心表征。这个被称为“非正式语域子空间”的抽象概念在模型更深的层中变得更加清晰,并且可以被操纵以因果性地改变输出的正式程度,这表明多语言LLM可以内化超越表面启发式规则的语用抽象。
-
新方法使用稀疏自编码器对文本数据进行因果调整
研究人员提出了一种使用稀疏自编码器(SAEs)对文本数据中的因果问题进行调整的新方法。该方法旨在平衡捕获混淆变量所需的密集表示与确保低方差估计所需的稀疏表示之间的需求。所提出的流程通过条件独立性测试迭代选择最小的SAE特征,在评估中显示出比替代方法更好的调整性能和可解释性。研究还强调了需要进一步研究现有的调整技术,以应对更复杂的多标签混淆场景。
-
新的KronSAE设计增强了稀疏自编码器的效率和可解释性
研究人员推出了一种新颖的稀疏自编码器(SAE)设计KronSAE,提高了其效率和可解释性。与将潜在字典视为扁平坐标的传统SAE不同,KronSAE将潜在空间分解为多个头,并使用低维预潜在变量的两两组合。这种方法施加了组合式共激活先验,增强了对相关特征结构的捕获能力,并降低了计算成本。KronSAE在EV-FLOPs等基准测试中表现出竞争力,并提供了更清晰的潜在特征可解释性。
-
新的NIFS方法通过稀疏自编码器增强LLM转向
研究人员开发了一种名为邻域集成特征选择(NIFS)的新方法,以提高使用稀疏自编码器(SAE)转向大型语言模型的有效性。传统方法基于统计分数选择特征,但这种方法可能会忽略属于语义相似组的重要特征。NIFS通过考虑表示相似性来解决这个问题,从而在各种任务和基于SAE的转向方法中实现更鲁棒的特征选择和一致的性能提升。
-
新的EXPOSE框架增强了病理学中VFM的可解释性
研究人员推出了一种名为EXPOSE的新型框架,旨在增强计算病理学中视觉基础模型(VFM)的可解释性和领域鲁棒性。通过采用稀疏自编码器(SAE),EXPOSE能够识别并减轻VFM嵌入中通常会混淆生物学和领域相关特征的领域特定信息。这种方法通过在大型前列腺癌数据集上的实验证明,可以提高跨领域泛化能力和嵌入鲁棒性。
-
新方法使用几何学来解释蛋白质语言模型特征
研究人员开发了一种新方法,通过使用蛋白质骨架的几何注释来解释蛋白质语言模型(pLMs)中的潜在特征。这种方法应用于ESM-2模型,揭示了局部几何形状与模型许多特征显著相关,比以前的数据库或基于序列的注释方法提供了更详细的理解。这些发现有助于区分具有相似数据库注释的特征,并为未注释的宏基因组蛋白质序列提供见解,而消融实验证明了几何特征对接触预测的影响。