一篇新的研究论文调查了Google的Gemma 2和Gemma 3语言模型中稀疏自编码器(SAE)特征的跨语言有效性。研究发现,尽管许多特征在不同语言中频繁出现,但它们对翻译任务的因果效应通常很小或不一致。然而,Gemma 2和Gemma 3中的一个特定特征在放大时,通过COMET分数衡量,一致地提高了翻译质量,而在消减时则降低了翻译质量,这表明存在一个与语言无关的翻译方向。 AI
影响 强调了当前跨语言解释LLM特征方法的局限性,表明需要更鲁棒的验证技术。
排序理由 研究论文发表在arXiv上,详细介绍了语言模型特征的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →