两篇新研究论文探讨了多语言大语言模型(mLLMs)的内部工作机制及其翻译能力。第一篇论文质疑了这些模型中单一“通用语”的概念,发现不同的探测方法在关于特定语言状态的结果上存在冲突。第二篇论文提出了一个更模块化的翻译视图,认为模型在生成目标语言的表面形式之前,会先建立目标词序,并有专门的注意力头负责句法转换。 AI
影响 这些研究为深入了解多语言模型如何处理和翻译语言提供了更深的见解,可能指导未来的模型开发和评估。
排序理由 两篇发表在arXiv上的学术论文,详细介绍了关于多语言LLM内部机制的新研究。
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- English
- Gaussian mixture model
- Gotit.pub
- Hugging Face
- Lingua Franca or Probing Artifact? Rethinking Latent Language in Multilingual LLMs
- Litmaps
- Multilingual Large Language Models
- ScienceCast
- scite Smart Citations
- Separating Syntax from Language: A Mechanistic Account of Translation in Multilingual LLMs
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →