一篇由作者Junyi Zou撤回的研究论文探讨了在适配器合并后,大型语言模型中潜在推理痕迹重新出现的现象。该研究在医学LLM环境中进行,引入了衡量痕迹泄露和指令遵循行为的新方法,包括一种标记禁止、仅回答的评估。作者还提供了领域适配器和指令适配器之间更新方向不一致的几何证据,并演示了一种概念验证的几何感知合并方法,以减轻泄露并提高准确性。 AI
影响 这项研究虽然被撤回,但为LLM中适配器合并的潜在安全问题和诊断方法提供了见解。
排序理由 该集群包含一篇撤回的学术论文,详细介绍了关于LLM适配器合并的研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →