PulseAugur
中
实时 22:54:13
English(EN) FTB Graph: Determining and Validating First-token Broadcasters and Language-Identity Head Circuits in Multilingual Language Models

新的FTB Graph方法绘制多语言LLM中的语言电路

研究人员开发了一种称为FTB Graph的方法来分析多语言大型语言模型的内部工作原理,特别是它们如何决定首先生成哪种语言。该技术使用边缘归因修补(Edge Attribution Patching)和精确激活修补(exact activation patching)来绘制GPT-2、BLOOM-560M、Pythia和Qwen2.5等各种模型中负责此决策的因果电路。研究发现,这些语言身份电路通常位于深层或中深层,并且其结构在预训练期间基本确定,指令调优对核心路由的影响很小。 AI

影响 提供了一种理解多语言LLM内部因果机制的新方法,有助于提高可解释性和控制性。

排序理由 该集群包含一篇详细介绍分析LLM电路新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的FTB Graph方法绘制多语言LLM中的语言电路

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Arjun Pillai, Christian Hoang, Anjelo Laroza ·

    FTB Graph:确定和验证多语言语言模型中的首个 token 广播者和语言-身份头部电路

    arXiv:2609.30954v1 Announce Type: new Abstract: Large language models operating in multilingual contexts must resolve target response languages early in generation, yet the causal circuitry governing first-token language identity decisions remains poorly mapped. We present an end…