PulseAugur
实时 17:29:25
实体 Rotary Position Embeddings

Rotary Position Embeddings

PulseAugur coverage of Rotary Position Embeddings — every cluster mentioning Rotary Position Embeddings across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_198210 ·

    新 arXiv 论文分析 RoPE transformer 的表达能力

    一篇新发布的 arXiv 论文探讨了 transformer 中旋转位置嵌入 (RoPE) 的表达能力。该研究将 RoPE 成功的两种常见解释形式化:一种将周期性位置信息与模态谓词联系起来,另一种则强调用于机制和长上下文研究的位置锚点和局部偏移。研究结果表明,虽然周期性 RoPE transformer 可以识别在过去时态逻辑中可定义的语言(具有模态谓词),但常规 RoPE 的非重复旋转提供了对固定偏移回溯算子的精度依赖性模拟,其行为…

  2. RESEARCH · CL_195677 ·

    新研究增强 Transformer 位置编码以更好地理解语言

    两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…

  3. TOOL · CL_167722 ·

    新研究探讨了具有旋转位置嵌入的自注意力动力学

    研究人员分析了在引入旋转位置嵌入(RoPE)时自注意力机制的动力学。他们的研究聚焦于单位球面上的归一化令牌动力学,揭示了RoPE会引入与正负号导数之间复杂的相互作用。分析表明,虽然共识状态仍然是平衡点,但其线性化是一个可逆的马尔可夫算子,取决于RoPE平面上共识点的能量。研究结果还详细介绍了不变区域、具有特定界限的收缩率,以及由RoPE选择的扭曲分支,该分支在某些配置中会导致不稳定性。

  4. TOOL · CL_160816 ·

    新方法在扩展上下文窗口后恢复LLM性能

    研究人员开发了LinearARD,一种新颖的自蒸馏方法,旨在恢复大型语言模型(LLM)在扩展上下文窗口后的性能。该技术侧重于对齐学生模型和教师模型之间的注意力动态,而不仅仅是匹配隐藏状态。通过使用线性内存核来高效管理注意力图,LinearARD显著减少了所需的训练token数量,在实现长上下文能力提升的同时,达到了原始短文本性能的98.3%。

  5. RESEARCH · CL_133181 ·

    新研究将RoPE频率使用与训练数据结构和长度泛化联系起来

    一篇新研究论文探讨了Transformer中的旋转位置嵌入(RoPE)如何非均匀地使用频率,并提出了一个以数据为中心的解释。研究表明,RoPE频率的选择是为了与训练数据的相对距离结构对齐,最优频率与数据诱导的依赖性剖面的宽度成反比。这一原理有助于解释语言模型中涌现的频率使用,并与长度泛化相关联,在长度泛化中,降低频率可以提高性能,当依赖性近似于训练时结构的扩张时。

  6. COMMENTARY · CL_118848 ·

    上下文工程:在大型上下文窗口之外优化LLM信息

    上下文工程已成为AI开发中的一个关键学科,其重点在于优化提供给大型语言模型(LLM)的信息,而不仅仅是增加上下文窗口的大小。这种做法涉及仔细选择和构建数据,以确保模型能够获得给定任务最相关的信息,从而提高推理能力、降低延迟并减少成本。采用了诸如语义分块、分层检索和上下文压缩等技术来最大化信号并最小化噪声,确保模型能够有效地利用呈现给它们的信息。

  7. RESEARCH · CL_115245 ·

    新方法增强 Transformer 可扩展性并减轻 AI 模型中的位置偏差 · 跟踪 4 个来源

    研究人员开发了两种新方法来提高 Transformer 模型的性能和可扩展性。一种方法 DPPE(解耦姿态位置编码)通过分离位置编码中的旋转和翻译信息来解决 3D 计算机视觉中的问题,从而在新的视图合成任务中实现更稳定的长期训练和更好的泛化能力。另一种方法 LPES(层特定的位置嵌入缩放)通过为每个层的 positional embeddings 应用独特的缩放因子来解决大型语言模型中的“中间丢失”问题,从而平衡注意力分布并在不增加延…

  8. TOOL · CL_54815 ·

    RoPE 嵌入革新 LLM 的位置感知能力

    本文解释了旋转位置嵌入 (RoPE),这是一种于 2021 年开发的方法,用于解决 Transformer 模型固有的位置感知缺失问题。与可能破坏语义含义并限制上下文长度的早期加性位置编码不同,RoPE 使用几何旋转来编码位置。这种方法因其有效处理绝对位置和相对距离的能力,已成为包括 LLaMA 3、Mistral、Qwen 2.5 和 Gemma 在内的许多领先开源 LLM 的标准。

  9. RESEARCH · CL_53833 ·

    新研究揭示Transformer上下文学习动力学

    两篇新研究论文探讨了Transformer模型上下文学习(ICL)的复杂性。第一篇论文引入了一个正式任务IC-recall,用于研究Transformer在ICL过程中如何利用存储在其参数中的事实知识,并证明在最小数据微调过程中会出现特定的成对注意力模式。第二篇论文研究了多模态ICL,揭示了一种学习不对称性,即主要模态的高多样性即使在次要模态数据有限的情况下也能实现有效多模态ICL,并识别出一种跨模态复制标签的归纳式机制。

  10. RESEARCH · CL_53477 ·

    AI模型PRISM简化了薄膜光学涂层设计

    研究人员开发了PRISM,一种新颖的自回归Transformer模型,旨在解决多层薄膜光学涂层设计的复杂逆问题。PRISM将材料选择和厚度预测整合到一个单一架构中,采用光谱前缀条件和累积深度旋转位置编码。基准测试表明,PRISM-13M在平均绝对误差(MAE)方面显著优于其他Transformer模型,同时使用的参数更少,而一个更大的变体实现了最先进的MAE,在速度和效率方面优于传统的优化方法。

  11. RESEARCH · CL_44066 ·

    SEGA方法增强了扩散Transformer的图像生成分辨率

    研究人员开发了SEGA,一种新颖的无需训练的方法,用于提高文本到图像生成中使用的扩散Transformer的分辨率外推能力。SEGA在去噪过程中自适应地调整潜在表示不同频率分量的注意力。与现有方法相比,这种方法提高了生成图像在更高分辨率下的结构连贯性和精细细节保真度。