PulseAugur
实时 13:17:44
实体 Marks et al.

Marks et al.

PulseAugur coverage of Marks et al. — every cluster mentioning Marks et al. across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_165006 ·

    新的训练方法通过减少信号损失来增强 LLM 的可解释性

    研究人员开发了一种名为“替换感知训练”的新方法,以提高大型语言模型的可解释性。该技术训练稀疏自编码器 (SAE),使其能够抵抗上层引入的错误,而之前的方​​法则依赖“错误节点”来补偿信号损失。当应用于 Gemma-2-2B 时,这种方法产生了一个保留了语言能力并在 MMLU 等基准测试中表现更好的替换模型,而标准的 SAE 通常会使模型不连贯。

  2. RESEARCH · CL_92823 ·

    Google DeepMind 使用合成数据训练 Gemini 3 Flash 以获得积极特质

    Google DeepMind 的研究人员开发了一种将积极特质灌输到其 Gemini 3 Flash 模型中的方法。该方法分为两个阶段:首先,在中期训练模型,使用描述 Gemini 展现期望属性的合成文档;然后,在它展示这些特质的合成聊天数据上进行微调。研究发现,聊天微调在稳健地嵌入这些特质方面特别有效,即使在分布外场景下也是如此,并分享了提高中期训练和监督微调有效性的见解。

  3. TOOL · CL_86836 ·

    语言模型神经元被发现是稀疏的,有助于可解释性

    研究人员已经证明,语言模型MLP层内的神经元表现出的稀疏度与稀疏自编码器(SAE)相当。这一发现使得开发用于电路追踪的基于梯度的管道成为可能,从而能够识别出具有因果效应的神经元。该方法已成功识别出约100个MLP神经元组成的电路,用于控制模型在主谓一致任务上的行为,并揭示了用于多跳城市-州-首都任务的推理步骤的特定神经元集,在没有额外训练成本的情况下推进了自动化可解释性。