研究人员引入了一种名为“跨编码引导评估”(Cross-Encoding Steering Evaluation)的新评估方法,以更好地理解激活引导在语言模型中控制的内容。该方法旨在区分对判断的真正控制与仅仅与答案标识符的兼容性。在NormBank上的实验表明,一种称为“对比激活加法”(Contrastive Activation Addition, CAA)的技术主要影响提取索引而非语义标签,这种现象被称为“提取索引跟随”(extraction-index following)。这种效应在模型的后期层中更为明显,并且在推理时干预方法(Inference-Time Intervention)中也观察到,尽管在MNLI和Social Chemistry 101等不同数据集上的结果有所不同。 AI
影响 引入了一种更严格的评估方法来理解模型内部机制,有可能实现对LLM输出更可靠的控制。
排序理由 该条目是一篇研究论文,详细介绍了一种评估语言模型行为的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- activation steering
- Contrastive Activation Addition
- Cross-Encoding Steering Evaluation
- MNLI
- Social Chemistry 101
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →