Position Interpolation
PulseAugur coverage of Position Interpolation — every cluster mentioning Position Interpolation across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
研究发现 RoPE 位置编码无法外推到更长上下文
与普遍看法相反,旋转位置嵌入(RoPE)本身并不能外推到比其训练数据显著更长的上下文。2017 年的早期研究表明正弦编码可能具有外推能力,但 2022 年的后续测量显示,正弦和 RoPE 方法的外推能力都有限。2023 年开发了一种称为位置插值(Position Interpolation)的技术,正是因为 RoPE 和类似方法难以进行长度外推,这表明自由外推的说法是不准确的。虽然 RoPE 具有其他优势,例如高效的 KV 缓存,但其…
-
RoPE维度无法旋转,破坏了LLM中的上下文扩展
一项技术分析显示,在以2k token窗口训练的模型中,32个RoPE维度中的11个从未完成完整旋转,这导致在推断超出训练上下文长度时出现算术错误和无意义的输出。这个问题源于这些维度的波长比训练窗口长,导致它们产生未见的角度。文章讨论了三种方法——位置插值、NTK感知缩放和YaRN——作为潜在的解决方案,每种方法在局部分辨率和训练要求方面都有权衡。然而,这些方法主要解决了模型表示位置的能力,而不是其在扩展上下文中有效利用信息的能力。
-
新研究增强 Transformer 位置编码以更好地理解语言
两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…