研究人员引入了一种名为拓扑正则化侧通路(TRSP)的新方法,以解决大型语言模型(LLMs)中的表示坍塌问题,该问题会随着上下文的增加而降低性能。TRSP使用一种无参数的三角盒机制来平衡注意力动态的光谱特性,从而提高混合效率和信息容量。实验证明了TRSP的有效性,在通用能力和长上下文基准测试中取得了显著的提升,尤其是在扩展训练长度的情况下,在NoLiMa上保持了83%的准确率,并且优于Differential Transformer和Gated Attention等现有方法。 AI
影响 通过缓解表示坍塌,提高了大型语言模型在长上下文任务上的性能。
排序理由 详细介绍大型语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Gated Attention
- Hugging Face
- Large Language Models
- LLMs
- NoLiMa
- Topologically Regularized Side-Path
- Triangular Box
- TRSP
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →