PulseAugur
中
实时 06:55:09
实体 Contrastive Activation Addition

Contrastive Activation Addition

PulseAugur coverage of Contrastive Activation Addition — every cluster mentioning Contrastive Activation Addition across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_218171 ·

    新研究质疑激活引导在语言模型中的有效性

    一篇新的研究论文探讨了语言模型中激活引导的现象,质疑观察到的收益是否反映了预期的控制还是与答案编码的兼容性。该研究引入了跨编码引导评估,通过重新编码答案来分离干预的效果。研究结果表明,像对比激活添加这样的方法通常追踪的是提取索引而不是语义标签,尤其是在模型的后期层。这表明引导收益可能并不总是能确定干预真正控制了什么,因为不同的评估方法可能会得出不同的结论。

  2. TOOL · CL_227826 ·

    新方法探究激活引导在语言模型中真正控制的内容

    研究人员引入了一种名为“跨编码引导评估”(Cross-Encoding Steering Evaluation)的新评估方法,以更好地理解激活引导在语言模型中控制的内容。该方法旨在区分对判断的真正控制与仅仅与答案标识符的兼容性。在NormBank上的实验表明,一种称为“对比激活加法”(Contrastive Activation Addition, CAA)的技术主要影响提取索引而非语义标签,这种现象被称为“提取索引跟随”(extra…

  3. TOOL · CL_191296 ·

    新方法通过分析大语言模型内部表征来检测错误信息

    研究人员开发了一种检测错误信息的新颖方法,该方法通过分析语言模型的内部表征来检测错误信息,而不是依赖外部知识或表面文本特征。这种被称为“潜在事实核查”的方法,通过对比真实和虚假陈述,利用激活工程来识别模型潜在空间中的“错误信息方向”。然后,通过多层感知器对新声明的激活进行投影分类。该技术不需要对基础模型进行微调,并在各种模型和基准测试中显示出有希望的结果,尤其是在较小的模型上,这表明真实性是这些模型表征中的一个结构化概念。

  4. TOOL · CL_187401 ·

    新的CircuitSteer框架通过多层语义电路增强LLM控制

    研究人员开发了一个名为CircuitSteer的新框架,该框架使用稀疏自编码器来识别和操纵大型语言模型多层中的特定语义电路。该方法通过从稀疏特征合成密集引导向量并应用多点干预,从而实现对模型行为的更精确控制。CircuitSteer在诸如对比激活加法等现有方法上表现出优越的性能,始终产生保持流畅性的干预,并有效地引导模型在各种任务和模型家族中执行诸如谄媚和拒绝等复杂行为。