Anthropic 的研究人员在其 Claude AI 模型中识别出一个认知工作空间,称为“J-Space”,模型在该空间中构建其推理过程,然后生成响应。这个内部空间包含一组有限的概念,类似于一个思维便签本,使 Claude 能够处理比其明确传达的更多的信息。Anthropic 开发的一种名为 J-lens 的新开源技术,可以解释这些内部概念,揭示 Claude 的关注点。这项技术不仅提供了对 Claude 推理过程的洞察,还能够直接操纵其内部状态以改变响应,证明了 J-Space 与模型输出之间的因果关系。 AI
影响 提供了一种理解和潜在控制 AI 模型推理的新方法,从相关性转向因果关系。
排序理由 研究论文,详细介绍了 AI 模型的新内部机制。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →