一篇新发表在arXiv上的研究论文对语言模型中激活引导的有效性提出了质疑。研究发现,将模型引导至特定行为(如礼貌)并不能孤立该行为,而是会将模型拉向一组默认的偏好行为,如拒绝、谄媚和诗意化。这种干预效应在十种不同的指令调优模型和24种不同的行为中都有观察到,并且在较小的模型中,这种倾向于默认行为的拉力更强。 AI
影响 挑战了当前语言模型控制技术中的模块化假设,表明在细粒度行为引导方面存在局限性。
排序理由 一篇发表在arXiv上的研究论文,详细介绍了关于语言模型行为的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- activation steering
- arXiv
- Hugging Face
- Instruction-Tuned Models
- language model
- poeticism
- refusal
- Steering Interference Reflects the Model's Defaults, Not the Behavior Directions
- sycophancy
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →