发表在arXiv上的一项研究表明,大型语言模型中的拒绝行为比之前理解的要复杂。不同的拒绝类别对应于激活空间中不同的方向,而不是单一方向的控制。虽然干预措施可以引导模型以统一的方式拒绝,但拒绝的潜在机制因类型而异。该研究利用稀疏自编码器来识别拒绝的共享和特定领域的潜在表示,突显了线性可解释性在理解模型对齐行为方面的局限性。 AI
影响 改进了对大型语言模型安全机制的理解,可能导致更细致的对齐技术。
排序理由 发表在arXiv上的研究论文,详细介绍了关于大型语言模型拒绝机制的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →