研究人员发现,大型语言模型(LLMs)中低资源语言和高资源语言之间的性能差异与其内部表示的几何特性有关。一项对30种语言的比较研究发现,LLMs在数据量较少的语言的最终层中表现出表示退化。为解决此问题,研究人员探索了在持续预训练过程中使用几何正则化技术,发现这些方法可以成功减少退化,并提供边际性能改进,尤其是在最具挑战性的任务上。 AI
影响 确定了LLM中低资源语言性能差距的几何基础,为有针对性的改进提供了新途径。
排序理由 学术论文,详细介绍了关于LLM表示的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →