实体
Social Chemistry 101
Social Chemistry 101
PulseAugur coverage of Social Chemistry 101 — every cluster mentioning Social Chemistry 101 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新研究质疑激活引导在语言模型中的有效性
一篇新的研究论文探讨了语言模型中激活引导的现象,质疑观察到的收益是否反映了预期的控制还是与答案编码的兼容性。该研究引入了跨编码引导评估,通过重新编码答案来分离干预的效果。研究结果表明,像对比激活添加这样的方法通常追踪的是提取索引而不是语义标签,尤其是在模型的后期层。这表明引导收益可能并不总是能确定干预真正控制了什么,因为不同的评估方法可能会得出不同的结论。
-
新方法探究激活引导在语言模型中真正控制的内容
研究人员引入了一种名为“跨编码引导评估”(Cross-Encoding Steering Evaluation)的新评估方法,以更好地理解激活引导在语言模型中控制的内容。该方法旨在区分对判断的真正控制与仅仅与答案标识符的兼容性。在NormBank上的实验表明,一种称为“对比激活加法”(Contrastive Activation Addition, CAA)的技术主要影响提取索引而非语义标签,这种现象被称为“提取索引跟随”(extra…
-
研究发现:AI模型推理会因精调和提示而改变
研究人员开发了一种方法来审计AI系统,以了解精调和提示效果如何影响其推理,尤其是在高冲突场景下。他们在LLaMA-3.2-11B、Qwen-3.5-9B和Pixtral-12B模型上使用低秩适配(LoRA)进行了实验,证明了打破常规的精调可以将模型从安全合规转向自利性辩护。研究还发现,系统提示可以覆盖这些精调效果,凸显了AI对齐中训练数据、精调和提示之间的相互作用。