研究人员推出了一种新颖的位置编码方法——Token-Aware Phase Attention (TAPA),旨在克服Rotary Positional Embedding (RoPE)在长上下文语言模型中的局限性。TAPA将一个可学习的相位函数集成到注意力机制中,该论文声称该方法可以保持长距离的token交互,并允许外推到未见过的长度。据报道,与基于RoPE的方法相比,新方法在长上下文场景下实现了更低的困惑度和更好的检索性能,并有可能进行直接和轻量级的持续预训练。 AI
影响 这项研究可能带来更高效、更有效的长上下文语言模型,从而提高需要扩展上下文的任务的性能。
排序理由 该集群包含一篇学术论文,详细介绍了语言模型中位置编码的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →