PulseAugur
实时 17:28:38
实体 self-attention

self-attention

PulseAugur coverage of self-attention — every cluster mentioning self-attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
14
90 天内 36
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 35
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/2 页 · 共 36 条
  1. TOOL · CL_214556 ·

    Transformer注意力机制中位置编码技术的映射

    本文探讨了Transformer架构中的位置编码技术,重点关注位置信息如何以及在何处被整合到注意力机制中。文章超越了按时间顺序的呈现方式,而是根据方法在注意力公式中的注入点进行分类。作者提出了一个2x2的网格(绝对与相对,固定与学习)来映射这些技术,并将其与原始Transformer在注意力层之前将位置向量添加到token嵌入中的方法进行了对比。

  2. TOOL · CL_213492 ·

    Transformer架构凭借自注意力机制革新大型语言模型

    Transformer架构,特别是其自注意力机制,通过实现并行处理和卓越的远距离依赖建模,彻底改变了大型语言模型。这与旧的循环神经网络(RNN)形成对比,后者顺序处理数据,导致在较长序列中信息丢失。Transformer允许每个单词同时关注所有其他单词的能力提供了全局视角,这对于理解细微关系和大规模生成连贯文本至关重要。

  3. TOOL · CL_206554 ·

    新研究为CycleGAN增强功能提供部署感知顺序

    一篇新研究论文提出了一种部署感知的采用顺序,用于循环一致对抗网络(CycleGANs)的增强功能。CycleGANs是一种用于图像到图像翻译的生成模型。该论文确定了四个关键增强功能,解决了诸如训练不稳定和纹理漂移等常见问题。它根据计算成本和对部署的影响对这些增强功能进行了分类,并为具有特定计算或延迟预算的团队提出了采用顺序。研究还详细介绍了如何在马到斑马的翻译任务中集成和评估这些增强功能,并报告了如Fréchet Inception …

  4. TOOL · CL_206045 ·

    新AI模型揭示行人流受远处城市区域影响

    研究人员开发了一种新颖的“基于环的Spatial Transformer”模型,以更好地理解建筑分布如何影响东京车站周围的行人流。该模型将自注意力应用于同心环缓冲区,将每个缓冲区视为一个空间标记,并且在预测准确性方面始终优于传统的地理加权回归。分析表明,行人流更多地受到跨越更远距离的交互作用的影响,而不仅仅是车站附近区域的影响,这挑战了传统的城市规划假设。

  5. RESEARCH · CL_206644 ·

    SQuad框架通过子二次注意力大幅降低视频Transformer的计算成本

    研究人员开发了SQuad,一个子二次注意力蒸馏框架,旨在提高视频扩散Transformer(DiTs)的效率。该新方法降低了自注意力机制的计算成本,该机制通常随token数量呈二次方增长。SQuad实现了O(n√n)的复杂度,显著降低了FLOPs和延迟,同时保持了可比的视频生成质量。

  6. RESEARCH · CL_198792 ·

    理解 Transformer:从分词到自注意力机制

    本文剖析了 Transformer 模型背后的核心概念,重点介绍了它们如何处理语言。文章解释了分词(tokenization),即将文本分割成更小的片段,以及分词 ID(token IDs),即这些片段的数值表示。该过程继续介绍嵌入(embeddings),将分词转换为捕获它们之间关系的向量,以及位置编码(positional encoding),它为序列中分词的位置添加信息。最后,文章深入探讨了自注意力机制(self-attenti…

  7. RESEARCH · CL_195832 ·

    New RISTER network achieves state-of-the-art in multi-oriented scene text recognition

    研究人员开发了一种新颖的旋转不变场景文本识别网络RISTER,旨在克服现实场景中多方向文本的挑战。与先前明确估计方向的方​​法不同,RISTER将旋转不变性直接集成到其编码器-解码器架构中。该网络在编码器中使用了旋转等变局部-全局提取网络,在解码器中使用了旋转不变的交叉注意力机制。这种方法为旋转不变性提供了理论保证,在不增加计算成本或依赖数据驱动的方向校正的情况下提高了鲁棒性,并在各种基准测试中展示了最先进的性能。

  8. RESEARCH · CL_195677 ·

    新研究增强 Transformer 位置编码以更好地理解语言

    两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…

  9. RESEARCH · CL_183118 ·

    新研究探索使用Transformer对动力学系统进行建模 · 跟踪2个来源

    两篇新的arXiv论文探讨了Transformer模型在理解和预测动力学系统中的应用。第一篇论文分析了单层Transformer的机械特性,将因果自注意力解释为历史依赖的递归,并识别了线性和非线性系统的运行模式。第二篇论文介绍了一种用于ODEFormer(一个将ODE轨迹映射到方程的预训练Transformer)的验证器引导工作流程,以提高这些模型向高维物理数据的可靠迁移能力,并实现可解释、物理可审计的预测。

  10. TOOL · CL_190063 ·

    BinaryPC 为高效 LLM 解码提供无需训练的稀疏注意力

    研究人员开发了 BinaryPC,这是一种新颖的稀疏注意力机制,旨在提高长上下文大型语言模型的效率。这种无需训练的方法使用二值主成分创建紧凑的哈希码,在无需基于梯度的训练的情况下保留结构数据信息。实验表明,BinaryPC 在保持与全注意力相当的准确性的同时,显著优于其他稀疏和基于哈希的方法,在现代 GPU 上与 FlashAttention 相比实现了 3.56 倍的吞吐量提升。

  11. TOOL · CL_171946 ·

    基于注意力的深度学习框架在阿尔茨海默病检测中准确率达88.95%

    研究人员开发了一种新颖的、基于注意力机制的深度学习框架,用于使用静息态功能磁共振成像(rs-fMRI)对阿尔茨海默病(AD)进行分类。该方法将大脑区域视为标记(tokens),并采用受Transformer启发的自注意力机制来模拟大脑网络内复杂的函数依赖关系。在阿尔茨海默病神经影像学倡议(ADNI)数据集上进行评估时,该框架在AD患者与认知正常个体之间的二元分类中达到了88.95%的准确率和0.90的ROC-AUC。

  12. TOOL · CL_169826 ·

    WHTMix 使用 Walsh-Hadamard 变换进行高效立体深度估计

    研究人员开发了 WHTMix,一种新颖的立体深度估计方法,它利用 Walsh-Hadamard 变换进行高效的 token 混合。该方法将 transformer 模型中计算成本高昂的自注意力机制替换为对数线性成本替代方案,在保持精度的同时显著降低了运行时间和模型计算量。WHTMix 方法在自动驾驶和机器人等高分辨率立体匹配任务中特别有效,并包含一个混合对数视差损失函数,可在没有额外计算开销的情况下提高对远处物体的精度。

  13. TOOL · CL_167722 ·

    新研究探讨了具有旋转位置嵌入的自注意力动力学

    研究人员分析了在引入旋转位置嵌入(RoPE)时自注意力机制的动力学。他们的研究聚焦于单位球面上的归一化令牌动力学,揭示了RoPE会引入与正负号导数之间复杂的相互作用。分析表明,虽然共识状态仍然是平衡点,但其线性化是一个可逆的马尔可夫算子,取决于RoPE平面上共识点的能量。研究结果还详细介绍了不变区域、具有特定界限的收缩率,以及由RoPE选择的扭曲分支,该分支在某些配置中会导致不稳定性。

  14. TOOL · CL_158175 ·

    大型语言模型自注意力机制深度解析

    本文深入探讨了自注意力机制,这是Transformer架构的核心组成部分,对大型语言模型(LLMs)至关重要。文章解释了自注意力如何使模型能够同时权衡不同输入部分的重要性,从而有效地捕捉长距离依赖关系和上下文关系。文章还详细介绍了自注意力的数学公式,包括多头注意力,并触及了其在机器翻译和文本摘要等自然语言处理任务中的应用。

  15. RESEARCH · CL_143393 ·

    SeamGen 模型可自动生成 3D 内容创作的 UV 接缝

    研究人员开发了 SeamGen,这是一种新颖的生成模型,旨在自动放置 3D 内容创作中的 UV 接缝。与依赖于逐对象优化或语义代理的先前方法不同,SeamGen 直接从艺术家编写的接缝布局中学习,并使用流匹配生成模型。该系统采用 Mesh Transformer 主干,结合了图注意力机制和自注意力机制,以有效处理网格拓扑和几何特征。这种方法使 SeamGen 能够生成更符合艺术家偏好和生产要求的 UV 布局,从而提供更好的感知质量。

  16. RESEARCH · CL_141178 ·

    研究人员将Transformer自注意力机制与几何算子统一起来

    一篇新研究论文提出了Transformer的统一算子视角,将自注意力机制视为一种“连接行走”。该研究详细阐述了单头注意力(SHA)和多头注意力(MHA)在此框架内的运作方式,并将它们与随机游走连接拉普拉斯算子等经典几何算子联系起来。在各种Transformer规模和结构上的实证研究支持了该理论,表明注意力图在更深层中趋于稳定,并且学习到的传输会随着模型尺寸的增加而在几何上组织起来。

  17. RESEARCH · CL_135153 ·

    AI框架通过人类反馈适应网联汽车中的异常检测 · 已追踪2个来源

    研究人员开发了一种新颖的网联汽车异常检测框架,集成了强化学习和人类反馈,以适应不断变化的系统行为。该系统利用具有自注意力的因子化深度Q网络来选择合适的检测器,并通过人类在环机制进行再训练。在自动代客泊车应用中进行的评估表明,该框架在软件更新和概念漂移后表现出改进的性能和持续的适应性,再训练后的F1分数达到0.65。

  18. TOOL · CL_122426 ·

    Apple 发布 MemoryLLM,用于可解释的 Transformer FFN

    Apple 的机器学习研究团队推出 MemoryLLM,这是一种增强 Transformer 模型中前馈网络 (FFN) 可解释性的新方法。通过将 FFN 与自注意力机制解耦,MemoryLLM 将 FFN 视为无上下文的神经检索记忆,从而可以研究输入 token 如何访问和利用 FFN 参数。这种方法允许将 FFN 作为 token 级别的查找进行预计算,通过允许在 VRAM 和存储之间按需传输来提高推理效率。此外,还提出了 Fle…

  19. RESEARCH · CL_117419 ·

    EcoVideo 框架优化了 DiT 视频生成在云边协同中的表现

    研究人员推出 EcoVideo,一个旨在优化 Diffusion Transformer (DiT) 模型视频生成的新框架,特别是在云边环境中。该系统根据信息密度动态解耦帧,信息密度通过自注意力熵估算。高熵关键帧由基于云的大模型处理,而低熵帧则通过轻量级边缘模型进行运动感知插值重建。EcoVideo 根据可用带宽和计算能力调整其处理方式,在受限的边缘环境中实现了高达 2.9 倍的速度提升,同时保持了质量。

  20. TOOL · CL_115673 ·

    新理论解释Whisper模型中的AI幻觉

    一篇新的研究论文引入了光谱敏感性定理来解释大型自动语音识别(ASR)模型中的幻觉。该定理预测了一个相变,模型从信号衰减转变为秩-1崩溃。该理论在Whisper模型上进行了测试,结果显示中间版本经历了结构分解,而较大的模型则进入了一个寻求压缩的吸引子状态,使其与声学证据脱钩。