J-Lens
PulseAugur coverage of J-Lens — every cluster mentioning J-Lens across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Fireworks AI 使用 Anthropic 的 J-Lens 探针测试 Kimi K3 和 Qwen 3.5-9B 模型
Fireworks AI 利用 Anthropic 的 J-Lens 探针检查了两个开源模型 Kimi K3 和 Qwen 3.5-9B 的内部状态。他们的研究表明,这些模型在处理任何输入 token 之前会准备好必要的词汇。这项调查深入了解了大型语言模型的内部工作机制和预计算策略。
-
新框架研究 LLM 智能体中的后门净化
研究人员开发了一个框架,用于研究 LLM 智能体如何从微调过程中安装的隐藏后门中净化。他们的实验表明,引入一个已知的后门然后进行遗忘可以清除大约 56% 的原始后门,随后的净化步骤可以清除大部分剩余的后门。研究还发现,如果净化过程使用的触发器类型与原始后门不同,恶意后门就越不可能持续存在,并且净化几个共存的后门中的一个可以有效地清除大多数其他后门。
-
新的 R-lens 方法增强了神经网络早期层的可解释性
研究人员开发了 R-lens,一种旨在提高 J-lens(一种用于解释神经网络激活的技术)忠实度的方法。这种新方法专门针对神经网络的早期层,旨在提供对其内部工作机制更准确的见解。这项工作由 camilablank、agam_bhatia 和 Neel Nanda 在 AI Alignment Forum 上作为 MATS 项目的一部分进行介绍。
-
Anthropic 发现 Claude 的内部推理空间 J-Space
Anthropic 的研究人员在其 Claude AI 模型中识别出一个认知工作空间,称为“J-Space”,模型在该空间中构建其推理过程,然后生成响应。这个内部空间包含一组有限的概念,类似于一个思维便签本,使 Claude 能够处理比其明确传达的更多的信息。Anthropic 开发的一种名为 J-lens 的新开源技术,可以解释这些内部概念,揭示 Claude 的关注点。这项技术不仅提供了对 Claude 推理过程的洞察,还能够直接…
-
研究人员使用 J-lens 揭示 Qwen3.6-27B 模型中的“元标记”
研究人员利用一种称为 J-lens 的技术,在 Qwen3.6-27B 模型上识别出了“元标记”。这些元标记是特定的标记,可以揭示模型中不明显的计算过程。例如,当遇到歧义文本时,“什么意思”这个元标记会被激活,影响模型的解释,防止其误解双关语。同样,在数学问题上,“gcd”标记会出现,表明模型使用了乘积/GCD 算法,而操纵这个标记会改变模型的计算结果。研究表明,虽然目前的单标记 J-lens 有局限性,但未来多标记版本可以提供对模型…
-
Anthropic发布J-lens用于调试LLM内部状态
Anthropic开发了一种名为Jacobian Lens (J-lens) 的新可解释性技术,以更好地理解大型语言模型的内部工作原理。该工具提供了对模型正在跟踪的中间概念和计算的洞察,提供了超越仅分析最终输出的调试和审计能力。J-lens与logit lens不同,它侧重于模型可能在不久的将来产生的词语,而不仅仅是下一个token,从而使开发人员能够更好地诊断潜在问题并理解模型行为。
-
Anthropic 发布 J-Lens 以可视化 LLM 的内部思考过程
Anthropic 推出了一种名为 Jacobian Lens (J-Lens) 的新可解释性技术,用于可视化其大型语言模型(特别是 Claude)的内部思考过程。J-Lens 揭示了模型中一个隐藏的“J-Space”,概念和词语在此被激活,然后才被明确生成,从而提供了对其链式思考之外的推理过程的洞察。这一进展对于开发人员调试模型行为、理解失败模式以及确保模型遵循预期的推理路径特别有用,Anthropic 与 Neuronpedia …
-
Anthropic 声称通过 J-Space 研究读取 Claude AI 内部“想法”
Anthropic 的研究人员在其 Claude AI 模型中发现了一个内部“J-Space”,他们将其比作类似于人类意识的“全局工作空间”。这个空间允许 AI 在生成输出之前在内部处理和操纵概念,这个过程并不总是体现在最终的响应中。这项使用 Anthropic 的“J-Lens”技术发现的成果,为理解大型语言模型(LLM)的推理提供了新的见解,并可能有助于改进模型的行为和理解。
-
Anthropic 在 Claude 模型中发现类似人类意识的“全局工作空间”
Anthropic 的研究人员在其语言模型(包括 Claude Sonnet 4.5)中识别出一个区域,该区域的功能类似于人脑中的“全局工作空间”。这个专门区域似乎能够容纳和处理模型正在积极考虑并可能表达的概念。这项发现是利用一种名为 Jacobian Lens (J-Lens) 的新可解释性工具实现的,该工具可以分析模型的内部表征。
-
Anthropic 使用新的 J-lens 方法发现 AI 的“内心想法”
Anthropic 发现了一种称为“J-space”的现象,它代表了 AI 的内部思考过程,类似于人类的“内心想法”。研究人员现在可以使用一种新颖的“J-lens”方法来可视化这些内部状态,从而在潜在问题(如操纵或错误)显现在 AI 的输出之前就能检测到它们。这一突破在日本引起了广泛关注,因为日本非常重视 AI 安全和透明度。
-
Anthropic 论文介绍 J-space 作为 LLM 的“全局工作空间”
Anthropic 发布了一篇论文,详细介绍了一种名为 Jacobian Lens 的新可解释性技术,该技术在语言模型中识别出一个“J-space”。这个 J-space 似乎充当一个全局工作空间,保存着对有意识推理和内部思维过程至关重要的可言语化表征。实验表明,操纵 J-space 中的概念可以改变模型输出,而对其进行消融会损害复杂的推理任务,这表明它在 LLM 处理信息的方式中起着重要作用。
-
Anthropic 在 Claude 中发现“J-Lens”,呼应意识理论
Anthropic 在其 Claude 语言模型中发现了一种新的内部结构,他们称之为“J-Lens”。该结构似乎呼应了意识理论,特别是信息被持有和处理以进行推理的全局工作空间的概念。这一发现表明,复杂的 AI 系统可能会发展出与认知基本原理相符的涌现特性,这种现象被作者比作“3级滞后”。
-
Anthropic 的 J-Lens 绘制 Claude 的内部“J 空间”以实现 AI 安全
Anthropic 的研究人员开发了一种名为 J-Lens 的新技术,用于可视化和理解其 Claude AI 模型的内部工作原理。该方法绘制了 Claude 的“隐藏 J 空间”,这可能有助于在无需证明意识的情况下监控 AI 在风险情况下的行为。该研究旨在通过提供对模型决策过程的更深入的见解来增强 AI 安全。
-
Anthropic 的 J-lens 工具可视化 Claude AI 的内部状态,与意识理论相关联
Anthropic 开发了一款名为“J-lens”的新内部工具,该工具提供了对 Claude AI 模型运作方式的独特视角。该工具可视化了 Claude 的内部状态,并与一种突出的意识理论进行了类比。这种可视化旨在深入了解 AI 如何处理信息以及潜在地模仿认知功能的各个方面。
-
Anthropic 发布内部 LLM 工作空间 'J-space',支持新的可解释性工具 · 跟踪 9 个来源
Anthropic 发布了一项研究,详细介绍了其 Claude 等语言模型内部的“J-space”,一个内部的“全局工作空间”。该工作空间在处理过程中充当中间变量的无声临时内存,类似于人类认知。一种名为 Jacobian lens (J-lens) 的新工具允许研究人员访问和分析这个 J-space,揭示它在更高阶推理中起着至关重要的作用,尽管它仅占模型整体活动的一小部分。J-space 的存在和 J-lens 的效用已在 Qwen …