一项技术分析显示,在以2k token窗口训练的模型中,32个RoPE维度中的11个从未完成完整旋转,这导致在推断超出训练上下文长度时出现算术错误和无意义的输出。这个问题源于这些维度的波长比训练窗口长,导致它们产生未见的角度。文章讨论了三种方法——位置插值、NTK感知缩放和YaRN——作为潜在的解决方案,每种方法在局部分辨率和训练要求方面都有权衡。然而,这些方法主要解决了模型表示位置的能力,而不是其在扩展上下文中有效利用信息的能力。 AI
影响 识别出LLM上下文扩展的一个核心限制,影响模型在长篇任务上的性能。
排序理由 对LLM特定组件(RoPE维度)及其对上下文扩展影响的技术分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →