PulseAugur
实时 07:21:40
实体 Sigmoid Attention

Sigmoid Attention

PulseAugur coverage of Sigmoid Attention — every cluster mentioning Sigmoid Attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_217752 ·

    新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能

    研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…

  2. TOOL · CL_100203 ·

    新框架统一分析深度Transformer动力学

    研究人员开发了一个新颖的框架来分析深度Transformer内部的复杂动力学,Transformer是许多机器学习任务的基础。通过将输入序列的演化建模为Vlasov方程,称为Transformer PDE,他们可以更好地理解注意力机制如何在层之间运作。该方法已推广到各种注意力变体,包括多头注意力、L2注意力、Sinkhorn注意力、Sigmoid注意力和掩码注意力,利用条件Wasserstein框架。该研究还独特地探索了非紧支撑的初始…

  3. RESEARCH · CL_11887 ·

    Sigmoid attention 改进了生物基础模型,实现了更快、更稳定的训练

    研究人员开发了一种名为 Sigmoid Attention 的新注意力机制,该机制在训练生物基础模型方面提供了显著改进。与传统的 softmax attention 相比,这种新颖的方法能够学习到更好的表示,实现高出 25% 的细胞类型分离度和更高的内聚度指标。此外,Sigmoid Attention 能够实现更快的训练,模型完成速度最多可提高 10%,并通过缓解 softmax attention 中固有的问题来增强稳定性。该团队还…