PulseAugur
中
实时 19:43:16
实体 EAP-IG

EAP-IG

PulseAugur coverage of EAP-IG — every cluster mentioning EAP-IG across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_277294 ·

    机制可解释性研究揭示目标级恢复差距

    一篇题为“我们是否正在恢复机制?机制可解释性中的目标级恢复差距”的新研究论文已在arXiv上发表。该论文调查了当前机制可解释性方法的有效性,该方法旨在理解AI模型的内部计算。研究人员发现,评估目标有时会偏向不太准确的电路,从而产生“目标级恢复差距”。在各种任务和方法中都观察到了这种差距,有相当一部分候选对被错误排序。研究表明,上下文失真(输入的变化会影响保留的组件)导致了这个问题。从完整模型的执行中恢复特定信号被证明可以纠正这些错误排…

  2. TOOL · CL_133565 ·

    新的 C-ΔΘ 方法将 LLM 安全拒绝嵌入模型权重

    研究人员开发了一种名为 C-ΔΘ(电路受限权重算术)的新方法,以提高大型语言模型的安全性。该技术旨在离线训练阶段直接将拒绝能力嵌入模型权重,而不是依赖于昂贵的推理时干预。通过识别和更新模型参数的一小部分,C-ΔΘ 创建了一个即插即用的编辑检查点,可以有选择地拒绝有害请求,同时保留其通用能力。

  3. RESEARCH · CL_93402 ·

    新的大型语言模型(LLM)电路发现方法解决了方差问题

    一篇新发表在arXiv上的研究论文探讨了大型语言模型(LLM)电路发现方法中的可变性。研究确定了三种主要的方差来源:重采样、改写和样本级方差。作者引入了CEAP,一种通过减少重采样方差来改进现有EAP-IG技术的新方法。他们还认为,改写方差表明,由于提示可以以多种方式激活不同的内部电路,因此大型语言模型(LLM)可能本质上难以控制。他们认为,样本级方差在很大程度上是良性的,与不忠诚的定义有关,而不是电路缺陷。