PulseAugur
实时 12:21:36
English(EN) 11 of 32 RoPE Dimensions Never Complete a Rotation in a 2k Window. That Is Why Context Extension Needs Tricks

RoPE维度无法旋转,破坏了LLM中的上下文扩展

一项技术分析显示,在以2k token窗口训练的模型中,32个RoPE维度中的11个从未完成完整旋转,这导致在推断超出训练上下文长度时出现算术错误和无意义的输出。这个问题源于这些维度的波长比训练窗口长,导致它们产生未见的角度。文章讨论了三种方法——位置插值、NTK感知缩放和YaRN——作为潜在的解决方案,每种方法在局部分辨率和训练要求方面都有权衡。然而,这些方法主要解决了模型表示位置的能力,而不是其在扩展上下文中有效利用信息的能力。 AI

影响 识别出LLM上下文扩展的一个核心限制,影响模型在长篇任务上的性能。

排序理由 对LLM特定组件(RoPE维度)及其对上下文扩展影响的技术分析。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

RoPE维度无法旋转,破坏了LLM中的上下文扩展

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Devanshu Biswas ·

    32个RoPE维度中的11个在2k窗口内从未完成旋转。这就是为什么上下文扩展需要技巧

    <p>A model trained at 2k tokens does not "get confused" past 2k. It <strong>breaks</strong>, and the reason is arithmetic you can compute in a few lines.</p> <p>RoPE encodes position as a rotation by <code>m · theta_i</code>. Attention then depends only on the <strong>relative</s…