Logit Lens
PulseAugur coverage of Logit Lens — every cluster mentioning Logit Lens across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的LLM-Microscope工具揭示了标点符号在Transformer上下文中的隐藏作用
研究人员开发了LLM-Microscope,这是一个用于分析大型语言模型如何处理和保留上下文信息的工具包。该工具显示,标点符号和限定词等看似微小的标记在维持上下文方面起着至关重要的作用,移除它们会显著影响MMLU和BABILong-4k等基准测试的性能。研究结果还强调了模型嵌入中的上下文化与线性度之间的强相关性,表明这些不太显眼的标记对于Transformer中的长距离理解至关重要。
-
新的 Jacobian Lens 工具测试 AI 模型是否使用内部信号
研究人员开发了一种新的可解释性工具,称为 Jacobian lens,旨在确定模型内部信号是否在其决策过程中被积极使用。与主要识别相关性的 logit lens 或 tuned lens 等先前方法不同,Jacobian lens 通过分析模型的平均 Jacobian 矩阵来实现可测试的干预。这使得研究人员能够选择性地编辑内部状态并观察预测的行为变化,为信号的功能作用提供了更强的证据。
-
新方法揭示语言模型中稳定的读出特征
研究人员推出了一种新颖的分析语言模型内部状态的方法——稀疏读出棱镜(Sparse Readout Prism, SRP)。该方法通过将读出矩阵分解为稀疏特征来实现。此方法旨在将隐藏状态的分析与用于训练读出的语料库分离开来,解决了“语料库条件性”问题,即不同的训练语料库可能导致对相同隐藏状态的不同解释。SRP揭示了读出特征作为一种新的分析单元,提供了一种更稳定、与语料库无关的方式来理解模型如何处理信息。
-
Anthropic的Jacobian Lens为AI模型隐藏层提供新见解
研究人员详细介绍了一种名为Jacobian lens (J-lens) 的新可解释性工具,由Anthropic开发。该工具解决了先前方法(如logit lens)的局限性,后者在准确解释语言模型的隐藏层时遇到困难。J-lens通过为每一层学习一个校正矩阵来工作,近似后续层执行的变换。这使得能够更准确地理解模型的内部“想法”或概念,正如在实验中所证明的那样,操纵这种内部表示会改变模型的输出。
-
新研究质疑语言模型中的叠加现象
一篇新论文分析了语言模型中“叠加”现象,即多个解决方案可能同时存在于单个表示中。研究人员使用三种不同的训练模式进行了调查:无训练、微调和从头开始训练。他们的发现表明,只有完全从头开始训练的模型才表现出利用叠加的迹象。相比之下,在无训练和微调模式下的模型要么崩溃了叠加,要么没有使用它,而是选择了捷径解决方案。
-
大语言模型难以解码主流传统之外的神话知识
一项新的研究论文调查了 18 个开源大语言模型如何体现和解码神话知识。研究发现,虽然模型可以体现关于宙斯、朱庇特和索尔等神祇的知识,但它们在一致地识别芬兰、斯拉夫、埃及或中国传统等代表性较低的神话中的对应神祇方面存在困难。研究表明,这种失败发生在解码或读出阶段,而不是在初始体现阶段,并且受到提示中使用的语言的影响。
-
Anthropic发布J-lens用于调试LLM内部状态
Anthropic开发了一种名为Jacobian Lens (J-lens) 的新可解释性技术,以更好地理解大型语言模型的内部工作原理。该工具提供了对模型正在跟踪的中间概念和计算的洞察,提供了超越仅分析最终输出的调试和审计能力。J-lens与logit lens不同,它侧重于模型可能在不久的将来产生的词语,而不仅仅是下一个token,从而使开发人员能够更好地诊断潜在问题并理解模型行为。
-
Anthropic 发布 J-Lens 以可视化 LLM 的内部思考过程
Anthropic 推出了一种名为 Jacobian Lens (J-Lens) 的新可解释性技术,用于可视化其大型语言模型(特别是 Claude)的内部思考过程。J-Lens 揭示了模型中一个隐藏的“J-Space”,概念和词语在此被激活,然后才被明确生成,从而提供了对其链式思考之外的推理过程的洞察。这一进展对于开发人员调试模型行为、理解失败模式以及确保模型遵循预期的推理路径特别有用,Anthropic 与 Neuronpedia …
-
Anthropic 论文介绍 J-space 作为 LLM 的“全局工作空间”
Anthropic 发布了一篇论文,详细介绍了一种名为 Jacobian Lens 的新可解释性技术,该技术在语言模型中识别出一个“J-space”。这个 J-space 似乎充当一个全局工作空间,保存着对有意识推理和内部思维过程至关重要的可言语化表征。实验表明,操纵 J-space 中的概念可以改变模型输出,而对其进行消融会损害复杂的推理任务,这表明它在 LLM 处理信息的方式中起着重要作用。
-
研究:LLM不确定性不改变推理动力学
一篇新的研究论文探讨了大型语言模型(LLM)在推理过程中如何处理不确定性。该研究利用了Logit Lens的一个变体Tuned Lens,分析了多个数据集和模型上的逐层概率轨迹。与一些预期相反,研究结果表明,不确定性不会显著改变输出令牌概率的推理动力学,确定性和不确定的预测在可比层上显示出相似的置信度增加。然而,研究也表明,更具能力的模型可能以不同的方式处理不确定性,这挑战了用于检测不确定性的简单方法。
-
研究发现:语音语言模型会隐式转录口语
一篇新发表在arXiv上的研究论文探讨了交织式语音语言模型(SLMs)的内部工作机制。研究表明,即使这些模型没有经过显式的语音识别训练,也会经历一个隐式的转录阶段。在此阶段,中间层可以解码口语的文本表示,转录文本在相当一部分数据中作为首选候选。随后,模型在文本域中预测下一个词,之后可能返回到语音域,这揭示了SLMs内部语音和文本模态的交互方式,并可能指导未来的优化。
-
新的Query Lens方法增强了AI模型的可解释性
研究人员推出了一种名为Query Lens的新方法,旨在提高AI模型中稀疏特征的可解释性。该技术通过分析激活特定模型组件的输入特征及其影响的输出来扩展现有方法。Query Lens还考虑了间接效应,即特征的影响通过模型的其他部分进行中介,从而提供比以往方法更全面的理解。