Logit Lens
PulseAugur coverage of Logit Lens — every cluster mentioning Logit Lens across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Anthropic发布J-lens用于调试LLM内部状态
Anthropic开发了一种名为Jacobian Lens (J-lens) 的新可解释性技术,以更好地理解大型语言模型的内部工作原理。该工具提供了对模型正在跟踪的中间概念和计算的洞察,提供了超越仅分析最终输出的调试和审计能力。J-lens与logit lens不同,它侧重于模型可能在不久的将来产生的词语,而不仅仅是下一个token,从而使开发人员能够更好地诊断潜在问题并理解模型行为。
-
Anthropic 发布 J-Lens 以可视化 LLM 的内部思考过程
Anthropic 推出了一种名为 Jacobian Lens (J-Lens) 的新可解释性技术,用于可视化其大型语言模型(特别是 Claude)的内部思考过程。J-Lens 揭示了模型中一个隐藏的“J-Space”,概念和词语在此被激活,然后才被明确生成,从而提供了对其链式思考之外的推理过程的洞察。这一进展对于开发人员调试模型行为、理解失败模式以及确保模型遵循预期的推理路径特别有用,Anthropic 与 Neuronpedia …
-
Anthropic 论文介绍 J-space 作为 LLM 的“全局工作空间”
Anthropic 发布了一篇论文,详细介绍了一种名为 Jacobian Lens 的新可解释性技术,该技术在语言模型中识别出一个“J-space”。这个 J-space 似乎充当一个全局工作空间,保存着对有意识推理和内部思维过程至关重要的可言语化表征。实验表明,操纵 J-space 中的概念可以改变模型输出,而对其进行消融会损害复杂的推理任务,这表明它在 LLM 处理信息的方式中起着重要作用。
-
研究:LLM不确定性不改变推理动力学
一篇新的研究论文探讨了大型语言模型(LLM)在推理过程中如何处理不确定性。该研究利用了Logit Lens的一个变体Tuned Lens,分析了多个数据集和模型上的逐层概率轨迹。与一些预期相反,研究结果表明,不确定性不会显著改变输出令牌概率的推理动力学,确定性和不确定的预测在可比层上显示出相似的置信度增加。然而,研究也表明,更具能力的模型可能以不同的方式处理不确定性,这挑战了用于检测不确定性的简单方法。
-
研究发现:语音语言模型会隐式转录口语
一篇新发表在arXiv上的研究论文探讨了交织式语音语言模型(SLMs)的内部工作机制。研究表明,即使这些模型没有经过显式的语音识别训练,也会经历一个隐式的转录阶段。在此阶段,中间层可以解码口语的文本表示,转录文本在相当一部分数据中作为首选候选。随后,模型在文本域中预测下一个词,之后可能返回到语音域,这揭示了SLMs内部语音和文本模态的交互方式,并可能指导未来的优化。
-
新的Query Lens方法增强了AI模型的可解释性
研究人员推出了一种名为Query Lens的新方法,旨在提高AI模型中稀疏特征的可解释性。该技术通过分析激活特定模型组件的输入特征及其影响的输出来扩展现有方法。Query Lens还考虑了间接效应,即特征的影响通过模型的其他部分进行中介,从而提供比以往方法更全面的理解。