PulseAugur
实时 07:10:18
实体 Rotary Position Embedding

Rotary Position Embedding

PulseAugur coverage of Rotary Position Embedding — every cluster mentioning Rotary Position Embedding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 13
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 13 条
  1. TOOL · CL_228854 ·

    新的HD-RoPE方法增强了Transformer的长上下文建模能力

    研究人员推出了一种新颖的旋转位置嵌入(RoPE)的扩展方法HD-RoPE,旨在提高Transformer在长上下文建模中的性能。与标准的RoPE的成对解耦结构不同,HD-RoPE利用更高维度的旋转和正交基来实现更深层次的通道混合和增强的鲁棒性。这种新方法更有效地整合了位置信息,在不增加额外可训练参数的情况下,在各种基准测试中取得了显著的性能提升。

  2. TOOL · CL_196169 ·

    LinkedIn 部署 CADET Transformer,广告点击率提升 11%

    LinkedIn 开发并部署了 CADET,这是一种用于预测广告点击率 (CTR) 的仅解码器 Transformer 模型。该新模型显著优于其之前的 LiRank 基线,在 A/B 测试中实现了 11.04% 的点击率提升。CADET 包含多项创新,包括上下文条件解码架构、自门控注意力机制以及基于时间戳的位置嵌入,所有这些都为高效的工业规模部署而设计。

  3. TOOL · CL_171897 ·

    新框架“Journey Operators”对多轴数据结构进行建模

    研究人员引入了一个名为 Journey Operators 的新框架,用于对图像或文本等多轴数据结构进行建模。该框架使用每轴变换来定义数据如何组合以及如何描述相对位置,确保跨独立轴的组合和移动是路径无关的。Journey Operators 背后的理论解释了 Rotary Position Embedding (RoPE) 及其变体等方法的出现,当应用于数据依赖变换时,它提供了内容自适应的位置归纳偏差。研究人员设计了一个名为 JoFo…

  4. TOOL · CL_171880 ·

    ClockRoPE 增强 LLM 的时间序列建模能力 · arXiv 研究

    研究人员开发了 ClockRoPE,一种用于时间序列建模的新颖方法,可增强基于 Transformer 的大型语言模型的性能,尤其是在顺序推荐任务中。这种新方法利用了源自注意力调制函数傅里叶变换的随机傅里叶旋转,以更好地捕捉时间周期性等复杂的距离相关模式。ClockRoPE 在在线 A/B 测试的参与度指标中显示出持续的改进,并且已经在大型视频分享平台的生成检索系统中投入生产使用。

  5. TOOL · CL_169790 ·

    新的谱系框架分析语言模型中的旋转注意力

    一篇新的研究论文介绍了一个谱系框架,用于分析Transformer语言模型中的旋转注意力。该框架超越了传统的向量几何,考察相位对齐、隐藏状态连续性和语义漂移。它提出,有序的隐藏状态序列(而不仅仅是词汇索引)适合进行谱分解,并将旋转位置嵌入(RoPE)注意力得分推导为幅度加权余弦项的总和。该论文还引入了复模态坐标和加权相干泛函,以区分表征连续性和执行边界可容许性。

  6. TOOL · CL_158525 ·

    AdaRoPE 通过特定头的位置嵌入增强 Transformer 性能

    研究人员引入了 AdaRoPE,一种新颖的旋转位置嵌入 (RoPE) 方法,解决了 Transformer 标准实现中的局限性。AdaRoPE 认为模型中的不同注意力头具有不同的功能角色,因此需要个性化的频率范围和缩放因子以获得最佳性能。通过为每个头配备可学习的参数,AdaRoPE 在短上下文和长上下文场景中均表现出改进的性能,优于 YaRN 等现有的 RoPE 变体。

  7. RESEARCH · CL_154440 ·

    新AI框架增强电池健康诊断与设计

    研究人员开发了两种新方法来改进电池健康诊断和设计。第一种方法RoSIP-Batt使用物理引导的Transformer网络,从充电曲线联合预测健康状态(SOH)和剩余使用寿命(RUL),在基准数据集上显著降低了误差。第二种框架采用物理信息学习与虚拟传感,从标准的BMS测量中推断难以测量的电池设计参数,从而实现更明智的电池设计并减少预测误差。

  8. RESEARCH · CL_145775 ·

    新的二维位置编码提升Transformer场景文本识别能力

    研究人员开发了一种新颖的二维旋转位置嵌入(2D-RoPE-STR)方法,以改进基于Transformer的场景文本识别(STR)。这种新方法通过更好地捕捉文本图像的二维空间结构来解决现有的一维位置编码的局限性,这对于处理弯曲、旋转和透视失真的文本至关重要。该方法引入了各向异性维度分配,并将旋转耦合扩展到编码器-解码器交叉注意力中,从而实现更准确的自回归解码。在六个标准基准上的评估显示,性能有了显著提升,尤其是在处理不规则文本布局方面。

  9. RESEARCH · CL_84408 ·

    nD-RoPE 将位置嵌入通用化,适用于高维AI模型

    研究人员推出nD-RoPE,一种将旋转位置嵌入(RoPE)推广到n维空间的新颖方法,解决了当前方法的局限性。这种新公式将位置和频率视为耦合的n维向量,能够实现更好的跨维度交互和方向无关的表示。实验表明,nD-RoPE在图像、视频和点云等各种高维数据类型上均提高了性能和泛化能力。

  10. RESEARCH · CL_45905 ·

    新的MLA注意力机制将LLM KV缓存削减高达10倍

    多头潜在注意力(MLA)是一种新颖的注意力机制,旨在显著压缩大型语言模型的KV缓存。通过将KV对投影到低维潜在空间,MLA实现了大量的缓存缩减,使DeepSeek-V2/V3和Kimi K2.x等模型能够以更少的内存处理更长的上下文和更大的批次。该技术改变了前缀缓存和注意力计算的实现方式,在模型推理过程中提供了内存使用和计算成本之间更有效的权衡。

  11. TOOL · CL_28501 ·

    Transformer架构详解:自注意力、RoPE和FFN

    Transformer架构,最初在“Attention Is All You Need”论文中提出,是现代大型语言模型(LLMs)的基础。关键组成部分包括自注意力(计算token关系)和多头注意力(允许并行处理不同类型的关系)。位置编码,例如Llama和Mistral等模型中使用的旋转位置嵌入(RoPE),对于传达token顺序至关重要,而前馈网络则存储事实知识并增强表达能力。

  12. TOOL · CL_16044 ·

    AI研究人员开发了用于通用建筑热模型的物理信息Transformer

    研究人员开发了一种物理信息Transformer架构,旨在创建住宅建筑的通用热模型。该模型嵌入了领域知识,并使用旋转位置嵌入注意力来捕捉时间依赖性,目标是在无需特定校准的情况下实现跨不同建筑和气候的泛化。在CityLearn数据集上进行评估,该模型表现出强大的预测准确性和零样本迁移能力,优于现有的基线模型和基础模型。

  13. TOOL · CL_15780 ·

    SHARP方法通过动态分辨率提升增强遥感图像合成

    研究人员开发了SHARP,一种用于增强扩散模型生成的遥感图像分辨率的新颖方法。SHARP在大量遥感图像数据集上对FLUX模型进行微调,以创建特定领域的先验知识,命名为RS-FLUX。然后,它采用一种无需训练的方法,在去噪过程中动态调整位置嵌入,以优化遥感数据的特定频率特征。