与普遍看法相反,旋转位置嵌入(RoPE)本身并不能外推到比其训练数据显著更长的上下文。2017 年的早期研究表明正弦编码可能具有外推能力,但 2022 年的后续测量显示,正弦和 RoPE 方法的外推能力都有限。2023 年开发了一种称为位置插值(Position Interpolation)的技术,正是因为 RoPE 和类似方法难以进行长度外推,这表明自由外推的说法是不准确的。虽然 RoPE 具有其他优势,例如高效的 KV 缓存,但其处理扩展上下文的能力并不像人们通常认为的那样强大。 AI
影响 挑战了大型语言模型(LLMs)中自由长度外推的假设,可能影响未来的模型架构和训练策略。
排序理由 该条目讨论了关于大型语言模型(LLMs)中位置编码方法外推能力的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
- Alibi
- Chen
- International Conference on Learning Representations
- Lewis
- llama
- news media
- Position Interpolation
- RoFormer: Enhanced Transformer with Rotary Position Embedding
- RoPE
- Smith
- Soviet Union
- Transformer++
- Vaswani
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →