研究人员开发了一种名为 FishBack 的新方法,以改进 Transformer 中的激活定向,这是一种无需更新参数即可修改语言模型行为的技术。现有方法由于激活空间是欧几里得空间的错误假设,通常不稳定,并且会干扰不相关的行为。FishBack 通过使用 softmax 层的 Fisher 信息度量,通过雅可比矩阵拉回,推导出最佳定向,从而纠正了这一点。该方法通过减少目标外失真,尤其是在几何校正影响最大的早期和中间层,在 GPT-2 Small、Llama 3-8B 和 Qwen3_8B 等模型上展示了改进的性能。 AI
影响 这项研究提供了一种更稳定、更精确的控制语言模型行为的方法,有望带来更可靠、更易于引导的 AI 系统。
排序理由 学术论文,详细介绍了一种新的 Transformer 激活定向方法。[lever_c_demoted from research: ic=1 ai=1.0]
- ActAdd
- FishBack
- Fisher information metric
- GPT-2 small
- Jacobian matrix
- Llama 3-8B
- Qwen3_8B
- Sihan Wang
- softmax layer
- Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →