研究人员开发了一种称为FTB Graph的方法来分析多语言大型语言模型的内部工作原理,特别是它们如何决定首先生成哪种语言。该技术使用边缘归因修补(Edge Attribution Patching)和精确激活修补(exact activation patching)来绘制GPT-2、BLOOM-560M、Pythia和Qwen2.5等各种模型中负责此决策的因果电路。研究发现,这些语言身份电路通常位于深层或中深层,并且其结构在预训练期间基本确定,指令调优对核心路由的影响很小。 AI
影响 提供了一种理解多语言LLM内部因果机制的新方法,有助于提高可解释性和控制性。
排序理由 该集群包含一篇详细介绍分析LLM电路新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →