Anthropic 开发了一种新的可解释性工具,名为 Jacobian lens。该工具揭示了 LLM 中一组特定的激活,这些激活似乎充当一个“工作区”。这个工作区表现出与模型通用激活模式不同的独特行为。 AI
影响 这项研究可能有助于更好地理解和控制 LLM 的行为,从而提高安全性和性能。
排序理由 该集群描述了一个主要 AI 实验室开发的新可解释性工具,这是一种研究形式。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →