PulseAugur
中
实时 04:12:41
实体 self-attention

self-attention

PulseAugur coverage of self-attention — every cluster mentioning self-attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
43
90 天内 43
发布 · 30天
0
90 天内 0
论文 · 30天
42
90 天内 42
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/3 页 · 共 45 条
  1. TOOL · CL_286915 ·

    新的Tucker瓶颈注意力方法提高了序列建模的效率

    研究人员开发了Tucker瓶颈注意力(TuBA),一种新颖的方法,用于解决自注意力在处理多维序列时的计算限制。TuBA利用低秩张量结构有效地混合全局token,将隐藏张量投影到注意力计算的紧凑核心中,然后再写回更新。这种方法在视频预测和全球天气预报等任务中,在准确性和效率方面提供了显著的改进,其表现优于标准和其他高效的注意力机制。

  2. RESEARCH · CL_280458 ·

    AI 研究:Transformer 策略可能掩盖多智能体行动崩溃

    一篇题为“Permutation Robustness Is Not Enough: Action Collapse in Multi-Agent Transformer Policies”的新研究论文探讨了将 Transformer 模型应用于多智能体机器人学习的挑战。研究强调,虽然 Transformer 可以模拟智能体交互,但其固有的排序可能导致策略中所有智能体选择相同动作,从而掩盖了潜在的排序敏感性。研究人员建议使用超越简单排…

  3. TOOL · CL_275053 ·

    新的脉冲对比注意力模块提高了变换器的效率

    研究人员开发了一种名为脉冲对比注意力(SCA)的新模块,以提高脉冲变换器(一种节能神经网络)的性能。通过分析这些网络的频谱特性,他们发现它们充当低通滤波器,丢失高频信息。SCA通过模仿生物视觉系统的边缘检测能力,使用对比原型和差分细化来增强高频分量,从而解决这个问题。该模块在图像分类和语义分割等各种任务中都显示出持续的改进,同时与现有方法相比,保持了较低的复杂性和卓越的效率。

  4. RESEARCH · CL_271199 ·

    新研究探索具有刚体力学和权重分析的 Transformer 架构 · 跟踪 5 个来源

    研究人员正在探索通过整合刚体力学和分析权重结构来增强 Transformer 架构的新方法。一篇论文介绍了“Screw Attention”,这是一种 Transformer 层,它使用刚体代数对物体之间的空间关系进行建模,在操作任务和几何变化鲁棒性方面表现出改进的性能。另一项研究“JET: Justification Evaluation in Transformer”专注于提高 Transformer 在 MMLU 等任务中的决策…

  5. RESEARCH · CL_271221 ·

    LLM 的注意力机制在新颖的语境和不同模型中表现出独特的行为 · 跟踪 3 个来源

    研究人员正在探索大型语言模型(LLM)的内部机制,特别是注意力函数,如何影响它们在新颖语境下的行为。一项研究提出了一种“函数混合注意力”(MoFA),该模型为 softmax 和 sigmoid 头分配固定的比例,发现这种比例对分布内任务的影响很小,但对分布外性能有显著影响,并根据比例区分文本类型。另一篇论文回顾了 LLM 中注意力机制的演变,通过记忆表示、更新、访问、读出和整合等视角分析了上下文记忆的发展,强调了深度和异构架构如何协…

  6. RESEARCH · CL_271147 ·

    研究人员量化语言模型中自注意力机制的令牌检索能力

    研究人员调查了语言模型中自注意力机制的检索能力,旨在了解模型上下文中有多少令牌被实际使用。该研究提出了一种通过保留具有最高注意力权重的令牌并观察其对负对数似然(NLL)的影响来测量有效注意力集合大小的方法。结果表明,相对较小的选定令牌集合可以使NLL接近全注意力基线,并且性能远超随机选择。研究还探讨了扩展上下文、支持事实的存在以及权重重整化如何影响所需的集合大小和模型的整体性能。

  7. TOOL · CL_239431 ·

    DeepONets:注意力机制对求解PDE的准确性至关重要

    研究人员对深度算子网络(DeepONets)进行了一项受控研究,以了解各种注意力机制对其性能的影响。该研究系统地评估了五种具有不同注意力配置的DeepONet变体,包括交叉注意力、自注意力以及分词(tokenization),分别在数据驱动和物理信息训练场景下进行。结果表明,结合了交叉注意力的每传感器分词显著降低了多个基准问题的误差率,其中查询依赖的交叉注意力被证明是最可靠的机制。

  8. TOOL · CL_229316 ·

    新型混合模型提升南极海冰预测能力

    研究人员开发了一种新颖的混合卷积-Transformer模型,用于预测南极海冰密集度。该模型利用卷积层有效捕捉局部空间模式,并利用自注意力机制捕捉长距离时间依赖性。通过引入季节性先验机制,特别是月感知位置编码和季节性时间偏差,该框架在短期和长期预测方面均展现出优于现有卷积和循环模型的性能。

  9. TOOL · CL_218965 ·

    AI 通过 CT 扫描中的 3D 视线模式预测放射科医师的专业水平

    研究人员开发了一种新颖的 Transformer 框架,该框架利用 3D 视线模式来预测放射科医师在 CT 扫描解读期间的专业水平。该模型使用 DINOv2 主干,通过自注意力偏差和视线加权池化将视觉搜索行为整合到体积特征学习中。该框架在 182 次 CT 阅读会话中进行了测试,取得了 0.91 的 ROC-AUC 和 0.86 的 F1 分数,优于现有方法,并为放射学中客观专业水平评估开辟了新途径。

  10. TOOL · CL_214556 ·

    Transformer注意力机制中位置编码技术的映射

    本文探讨了Transformer架构中的位置编码技术,重点关注位置信息如何以及在何处被整合到注意力机制中。文章超越了按时间顺序的呈现方式,而是根据方法在注意力公式中的注入点进行分类。作者提出了一个2x2的网格(绝对与相对,固定与学习)来映射这些技术,并将其与原始Transformer在注意力层之前将位置向量添加到token嵌入中的方法进行了对比。

  11. TOOL · CL_213492 ·

    Transformer架构凭借自注意力机制革新大型语言模型

    Transformer架构,特别是其自注意力机制,通过实现并行处理和卓越的远距离依赖建模,彻底改变了大型语言模型。这与旧的循环神经网络(RNN)形成对比,后者顺序处理数据,导致在较长序列中信息丢失。Transformer允许每个单词同时关注所有其他单词的能力提供了全局视角,这对于理解细微关系和大规模生成连贯文本至关重要。

  12. TOOL · CL_206554 ·

    新研究为CycleGAN增强功能提供部署感知顺序

    一篇新研究论文提出了一种部署感知的采用顺序,用于循环一致对抗网络(CycleGANs)的增强功能。CycleGANs是一种用于图像到图像翻译的生成模型。该论文确定了四个关键增强功能,解决了诸如训练不稳定和纹理漂移等常见问题。它根据计算成本和对部署的影响对这些增强功能进行了分类,并为具有特定计算或延迟预算的团队提出了采用顺序。研究还详细介绍了如何在马到斑马的翻译任务中集成和评估这些增强功能,并报告了如Fréchet Inception …

  13. TOOL · CL_206045 ·

    新AI模型揭示行人流受远处城市区域影响

    研究人员开发了一种新颖的“基于环的Spatial Transformer”模型,以更好地理解建筑分布如何影响东京车站周围的行人流。该模型将自注意力应用于同心环缓冲区,将每个缓冲区视为一个空间标记,并且在预测准确性方面始终优于传统的地理加权回归。分析表明,行人流更多地受到跨越更远距离的交互作用的影响,而不仅仅是车站附近区域的影响,这挑战了传统的城市规划假设。

  14. RESEARCH · CL_206644 ·

    SQuad框架通过子二次注意力大幅降低视频Transformer的计算成本

    研究人员开发了SQuad,一个子二次注意力蒸馏框架,旨在提高视频扩散Transformer(DiTs)的效率。该新方法降低了自注意力机制的计算成本,该机制通常随token数量呈二次方增长。SQuad实现了O(n√n)的复杂度,显著降低了FLOPs和延迟,同时保持了可比的视频生成质量。

  15. RESEARCH · CL_198792 ·

    理解 Transformer:从分词到自注意力机制

    本文剖析了 Transformer 模型背后的核心概念,重点介绍了它们如何处理语言。文章解释了分词(tokenization),即将文本分割成更小的片段,以及分词 ID(token IDs),即这些片段的数值表示。该过程继续介绍嵌入(embeddings),将分词转换为捕获它们之间关系的向量,以及位置编码(positional encoding),它为序列中分词的位置添加信息。最后,文章深入探讨了自注意力机制(self-attenti…

  16. RESEARCH · CL_195832 ·

    New RISTER network achieves state-of-the-art in multi-oriented scene text recognition

    研究人员开发了一种新颖的旋转不变场景文本识别网络RISTER,旨在克服现实场景中多方向文本的挑战。与先前明确估计方向的方​​法不同,RISTER将旋转不变性直接集成到其编码器-解码器架构中。该网络在编码器中使用了旋转等变局部-全局提取网络,在解码器中使用了旋转不变的交叉注意力机制。这种方法为旋转不变性提供了理论保证,在不增加计算成本或依赖数据驱动的方向校正的情况下提高了鲁棒性,并在各种基准测试中展示了最先进的性能。

  17. RESEARCH · CL_195677 ·

    新研究增强 Transformer 位置编码以更好地理解语言

    两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…

  18. RESEARCH · CL_183118 ·

    新研究探索使用Transformer对动力学系统进行建模 · 跟踪2个来源

    两篇新的arXiv论文探讨了Transformer模型在理解和预测动力学系统中的应用。第一篇论文分析了单层Transformer的机械特性,将因果自注意力解释为历史依赖的递归,并识别了线性和非线性系统的运行模式。第二篇论文介绍了一种用于ODEFormer(一个将ODE轨迹映射到方程的预训练Transformer)的验证器引导工作流程,以提高这些模型向高维物理数据的可靠迁移能力,并实现可解释、物理可审计的预测。

  19. TOOL · CL_190063 ·

    BinaryPC 为高效 LLM 解码提供无需训练的稀疏注意力

    研究人员开发了 BinaryPC,这是一种新颖的稀疏注意力机制,旨在提高长上下文大型语言模型的效率。这种无需训练的方法使用二值主成分创建紧凑的哈希码,在无需基于梯度的训练的情况下保留结构数据信息。实验表明,BinaryPC 在保持与全注意力相当的准确性的同时,显著优于其他稀疏和基于哈希的方法,在现代 GPU 上与 FlashAttention 相比实现了 3.56 倍的吞吐量提升。

  20. TOOL · CL_171946 ·

    基于注意力的深度学习框架在阿尔茨海默病检测中准确率达88.95%

    研究人员开发了一种新颖的、基于注意力机制的深度学习框架,用于使用静息态功能磁共振成像(rs-fMRI)对阿尔茨海默病(AD)进行分类。该方法将大脑区域视为标记(tokens),并采用受Transformer启发的自注意力机制来模拟大脑网络内复杂的函数依赖关系。在阿尔茨海默病神经影像学倡议(ADNI)数据集上进行评估时,该框架在AD患者与认知正常个体之间的二元分类中达到了88.95%的准确率和0.90的ROC-AUC。