Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
PulseAugur coverage of Inference-Time Intervention: Eliciting Truthful Answers from a Language Model — every cluster mentioning Inference-Time Intervention: Eliciting Truthful Answers from a Language Model across labs, papers, and developer communities, ranked by signal.
-
新的门控激活引导方法可对抗大型语言模型的谄媚和幻觉
研究人员开发了一种名为门控激活引导的新方法,用于减少大型语言模型中的谄媚和幻觉,特别是在医疗问答方面。该技术使用推理时干预(Inference Time Intervention)来应用针对幻觉和谄媚的引导方向,仅在必要时进行干预。在电子健康记录的评估中,该方法显著提高了40亿参数模型的鲁棒性,使其能够承受用户压力,并保持与更大模型相当的准确响应,而无需更改模型权重。
-
新研究质疑激活引导在语言模型中的有效性
一篇新的研究论文探讨了语言模型中激活引导的现象,质疑观察到的收益是否反映了预期的控制还是与答案编码的兼容性。该研究引入了跨编码引导评估,通过重新编码答案来分离干预的效果。研究结果表明,像对比激活添加这样的方法通常追踪的是提取索引而不是语义标签,尤其是在模型的后期层。这表明引导收益可能并不总是能确定干预真正控制了什么,因为不同的评估方法可能会得出不同的结论。
-
新方法探究激活引导在语言模型中真正控制的内容
研究人员引入了一种名为“跨编码引导评估”(Cross-Encoding Steering Evaluation)的新评估方法,以更好地理解激活引导在语言模型中控制的内容。该方法旨在区分对判断的真正控制与仅仅与答案标识符的兼容性。在NormBank上的实验表明,一种称为“对比激活加法”(Contrastive Activation Addition, CAA)的技术主要影响提取索引而非语义标签,这种现象被称为“提取索引跟随”(extra…
-
新研究揭示了大型语言模型中的“反向”转向向量
研究人员在转向向量(SVs)中发现了一种“反向检测-控制现象”,SVs是一种用于影响大型语言模型输出的技术。当具有高度辨别力的SV,本意是促进特定概念时,实际上会导致模型表现出相反的行为。该研究提出了一种在无需生成响应的情况下区分这些“反向转向向量”(ISVs)的方法,从而能够进行有针对性的符号翻转以改进转向流程。该方法在不同模型和概念的30项实验中的27项中均显示出改进。
-
新方法解决持续学习中的灾难性遗忘问题 · 跟踪8个来源
研究人员正在开发新方法来解决持续学习中的灾难性遗忘问题,即模型在学习新任务时会丢失先前获得的知识。几篇论文提出了新颖的技术,包括可学习的小波激活、技能引导的自适应记忆检索和持续蒸馏学习。其他方法侧重于表示微调、激活加权自适应保留和分组 LoRA 适配器合并,以提高模型的塑性和稳定性。这些进展旨在使模型能够更有效地进行顺序学习并适应不断变化的数据流。